GPT-Red: Automated Red Teaming via Self-Play at Scale
GPT-Red 利用大规模 Self-play 算法训练红队智能体,成功挖掘出针对顶级大模型 Prompt injection 的新型攻击手段。该研究在 GPT-5.6 的对抗性训练中发挥了关键作用,实验规模堪称安全训练之最。它不仅在实战中超越了人类专家的表现,还展示了安全防御系统的自我进化潜力。 [link]
2026/7/31 · CyberRadar
GPT-Red 利用大规模 Self-play 算法训练红队智能体,成功挖掘出针对顶级大模型 Prompt injection 的新型攻击手段。该研究在 GPT-5.6 的对抗性训练中发挥了关键作用,实验规模堪称安全训练之最。它不仅在实战中超越了人类专家的表现,还展示了安全防御系统的自我进化潜力。 [link]
针对系统被攻破后的取证难题,SecRespond 建立了首个针对事件响应工作流的基准测试。它涵盖 10 个真实云主机环境和多种 ATT&CK 攻击技术,要求智能体从磁盘快照和告警中生成修复建议。实验发现现有大模型在主动调查和验证修复方案上存在巨大缺口,为自动化安全运维指明了突破方向。 [link]
面对能够自动化渗透的智能体,AgentSnare 提出了一套动态诱骗系统。它通过轨迹自适应技术实时构建虚假环境,将攻击智能体引入歧途。在针对多个 CVE 漏洞的测试中,该系统成功吸收了超过一半的攻击动作,且没有一个真实目标被成功攻陷。这标志着防御策略从静态陷阱转向了主动的动态博弈。 [link]
协议转换竟然成为了 DoS 攻击的温床。CDN Tsunami 揭示了 HTTP/3 与 HTTP/1.1 部署不一致带来的严重漏洞,攻击者只需极小流量即可在主机端引发带宽和连接数爆炸。研究人员在 Tranco 前百万域名中锁定了数万个潜在受害者,相关发现已获得多家 CDN 厂商的官方致谢与漏洞赏金。 [link]
超过七成的漏洞需要跨函数分析才能准确定位,传统的静态检测器往往对此无能为力。VulAgentRL 引入强化学习智能体,通过查询 Code Property Graph 自主收集证据。其核心创新在于利用图节点标识符进行精确的奖励验证,确保智能体的推断真实可靠。该框架在跨仓库漏洞检测任务中表现出色。 [link]
供应链安全威胁迫在眉睫,恶意提交和后门组件层出不穷。Lily 将后门检测无缝集成到 CI 流水线和发布审核中。它结合 Fuzzing 技术与历史执行数据,能够精准识别代码变更中的可疑触发器。即便面对数百万行的代码更新,它也能快速定位恶意逻辑,曾成功拦截现实世界中的后门注入事件。 [link]
顶尖黑客的行为往往如幽灵般隐蔽,但目前的攻击智能体是否具备这种素质?StealthBench 提供了首个衡量自动化智能体隐蔽性的基准,涵盖 6 个关键维度。测试显示目前没有模型能兼顾任务达成与隐蔽操作。该工具的发布为开发隐蔽性强的安全工具以及监控非法自动化攻击提供了重要支撑。 [link]
AI 真的能从头发现真实的 CVE 漏洞吗?HoF-Bench 选取了 95 个由 AI 发现的公开漏洞,并设置了极其严格的评判准则。研究发现,即便是轻量级模型在合理的脚手架辅助下,也能复现近七成的历史漏洞。这一成果剥离了商业宣传的迷雾,用扎实的数据评估了自动化漏洞扫描器的真实水平和可靠性。 [link]
记忆系统让智能体变聪明的同时也埋下了隐患。MemSecBench 追踪了恶意指令在智能体记忆系统中的全生命周期,从写入、执行到尝试修复。通过 310 个真实案例,研究揭示了恶意记忆极易持久化,且现有的修复机制往往顾此失彼。这为构建具备记忆安全保障的长时程智能体提供了关键实验数据。 [link]
现代电网对通信延迟和可靠性有着苛刻要求。QUIC-TRIP 针对电力协议缺乏加密的问题,提出了一种基于传输层代理的安全方案。它通过三路径冗余传输实现了极高的容错能力,且 Round-Trip Time 优于 OpenVPN 等方案。该方法无需修改终端设备,即可为工业控制网络提供零信任架构下的实时安全保障。 [link]
旅游规划是测试 LLM Agent 工具调用能力的终极试炼。 TREK 引入了包含 800 个复杂约束任务的基准测试,涵盖航班、酒店及景点等 21 万条真实记录。它摒弃了模糊的评分指标,采用完全确定性的规则评估,确保结果可审计且可复现。即便最强的 GPT-5.6 在满足旅行者潜在需求方面也举步维艰。该研究为开发真正可用的行程规划助手指明了方向,是通往具身智能应用的关键一步。 [link]
医疗数据科学要求 Agent 能处理海量且异构的长周期记录。 ClinLens 填补了这一空白,提供了覆盖 200 个可执行任务的基准。它整合了结构化电子健康档案、心电图及影像资料等五类核心资源。研究发现即使是当前顶尖的配置,在严格通过率上也仅能达到 56.3% 。这一成果揭示了可运行代码与正确临床分析之间的巨大鸿沟,为构建可审计的医疗 AI 系统奠定了工程基础。 [link]
集成电路前端设计中,功能验证占据了绝大部分工程精力。 GoGoTB 框架实现了端到端的验证闭环,在 8 个 RTL 设计测试中达到了 100% 的环境生成成功率。它通过 Agent 执行控制层将确定性工具与 LLM 推理分离,配合可进化的知识系统,显著提升了覆盖率。该方案在无需人工干预的情况下,使功能覆盖率均值超过 83% 。它为自动化芯片设计与验证提供了极具实战价值的工程方案。 [link]
自动化因子挖掘已成为量化投资的核心。 AlphaSchema 通过构建结构化的交易语义空间,解决了代理在探索因子时盲目且不可控的问题。它将探索与实现解耦,利用代理模型平衡全局搜索与局部优化。在股票市场的实验证明,该方法能发现具有强预测能力的投资组合。这种将金融语义转化为可执行因子的严谨流程,极大提升了 AI 在高价值决策场景中的鲁棒性与专业度。 [link]
银行等受监管领域的对话机器人部署一直受困于验证成本。该研究提出利用数字孪生技术创建高保真合成客户代理,基于真实交易数据生成多样化的交互画像。配合自动化评估与对抗性探测,这套框架成功帮助英国领先银行完成了合规性验证。它不仅保证了语义对齐,还大幅降低了幻觉率。这为金融机构提供了一条通往规模化安全部署的可行路径,平衡了技术创新与合规安全。 [link]
指令层级结构是模型部署的安全基石,但大模型常被用户指令绕过系统约束。 V-Steer 是一种无需训练的推理阶段干预方法,通过编辑缓存中的值向量来恢复特权影响。它利用归因机制识别冲突位置,并实施原地倍数编辑。在 7B 到 70B 规模的模型测试中,主约束准确率从 18% 飙升至 92% 。该技术兼容现有的融合注意力后端,且解码开销极低,为实时安全防御提供了高效手段。 [link]
现有的代理通常将长期记忆视为外部挂载模块。 Metis 首次探索了具有原生记忆能力的记忆基础模型。它通过特殊的架构设计,将历史信息压缩进模型内部的持久化记忆状态。其在线维护过程无需梯度更新,仅需前向计算即可完成知识沉淀。实验表明,这种端到端优化的原生记忆在推理效率和长程一致性上具有显著优势。这一突破性尝试标志着基础模型正从单纯的推理机演变为具备自我记忆能力的智能体。 [link]
关于 AI 代理能否自动化科研的讨论日益激烈。该研究引入了影子评估机制,让代理挑战顶级会议投稿中的核心研究问题,并由原作者亲自打分。实验耗费数千美元算力,结果显示代理虽能胜任工程编码,但在科研生命周期的关键环节表现欠佳。论文识别出代理在判断力缺失、路径回溯失效及指令偏移等方面的五大失效模式。这为我们审视科研自动化进程提供了最接近真实场景的客观证据。 [link]
办公自动化是 LLM Agent 最具潜力的应用场景。 OmegaUse-OfficeVal 提供了包含 100 个长程办公任务的基准,且具备独特的经济性锚点。每个任务都标注了人力成本和价格参考,支持将推理费用与人力投入进行直接对比。虽然当前的 frontier 模型在速度和成本上完胜人类,但在交付质量上仍存在明显差距。该数据集完全开源,为开发者优化企业级代理的投入产出比提供了精确的衡量标准。 [link]
微调过程极易引入恶意投毒,导致模型在保留专业能力的同时潜伏安全隐患。 ROPD 框架摒弃了针对特定模板的补救方式,转而建模对齐分布与受损分布之间的差异。它采用基于路由的在线策略蒸馏,能有效抵御针对指令模板的规避攻击。实验显示该方法在维持下游任务性能的同时,显著提升了安全重对齐的稳定性。它为构建能自我防御恶意诱导的强鲁棒性模型提供了关键的技术方案。 [link]
俄罗斯国家支持的黑客组织 Laundry Bear,也被称为 Void Blizzard,正在邮件攻击活动中利用 Exchange Outlook Web Access 漏洞。他们以此分发名为 OWAReaper 的复杂后门程序。 [link]
攻击者在获取初始访问后很少停止行动。Huntress 分析了一起真实入侵事件,展示了威胁行为者如何建立持久化、禁用防御并重塑受损系统。防守方必须调查原始入口点,不应只清除恶意软件。 [link]
Google 表示 AI 正在大幅增加其发现并修复 Chrome 安全漏洞的数量。随着 AI 使用规模的扩大,该浏览器在最近两个版本中修复了超过 1000 个安全漏洞。 [link]
住宅安保公司 Brinks Home 披露黑客入侵了其部分系统。攻击者目前威胁要泄露窃取的资料。 [link]
威胁行为者在 Microsoft Teams 通话中冒充 IT 支持人员,以获取企业设备的远程访问权限。这些针对北美组织的攻击旨在部署 Chaos 勒索软件。 [link]
美国半导体公司 Analog Devices 宣布,未经授权的第三方访问了其部分系统并窃取了某些文件。 [link]
Amazon 将多起针对 npm 生态系统的高调开源软件供应链攻击归因为朝鲜黑客。 [link]
Broadcom 发布了安全更新,修复了 VMware vCenter、ESX、Workstation 和 Fusion 中的 5 个漏洞。其中包括 3 个关键漏洞,允许攻击者绕过身份验证、执行任意代码或实现虚拟机逃逸。 [link]
韩国个人信息保护委员会对电信巨头 KT Corporation 处以 539.79 亿韩元罚款,约合 3900 万美元。该公司因违反数据保护规定面临处罚。 [link]
JetBrains 警告 TeamCity On-Premises 存在严重的身份验证绕过漏洞。该漏洞可能被利用以实现远程代码执行。 [link]