Antiproof: Synthesizing Vulnerability Detectors and Proofs of Exploitability
发现漏洞不难,难在证明其可利用性。Antiproof 系统结合神经符号探测器与自动漏洞验证,实现了极高的召回率。它在 Ray 和 vLLM 等主流 AI 框架中挖掘出数百个未知漏洞,并斩获 12 个 CVE 编号。该工具通过生成可执行的攻击证明,解决了静态分析误报过多的痛点。它是保障大模型训练环境安全的利器。 [link]
2026/7/16 · CyberRadar
发现漏洞不难,难在证明其可利用性。Antiproof 系统结合神经符号探测器与自动漏洞验证,实现了极高的召回率。它在 Ray 和 vLLM 等主流 AI 框架中挖掘出数百个未知漏洞,并斩获 12 个 CVE 编号。该工具通过生成可执行的攻击证明,解决了静态分析误报过多的痛点。它是保障大模型训练环境安全的利器。 [link]
容器逃逸是云原生安全的噩梦。Bulkhead 框架利用大模型与形式化方法,专门猎杀由于文件系统隔离失效导致的路径遍历漏洞。它能自动定位高风险的跨边界交互点,并生成验证脚本与修复补丁。通过多智能体协作与断言驱动验证,它在支持 AI 负载的复杂容器环境中表现出色。这套系统为云端资源的逻辑隔离筑起了新防火墙。 [link]
程序员正大规模使用 AI 智能体辅助开发。这项针对 16112 次文件变更的实证研究揭示了惊人真相。约 38.9% 的智能体生成的代码变更包含安全缺陷,其中硬编码凭据占严重漏洞的 99.6%。开发者对 AI 的过度信任导致警惕性下降,超过 80% 的凭据泄露在集成前未被发现。研究呼吁在协作环节直接部署上下文感知的安全护栏。 [link]
攻击者正试图通过恶意二进制文件误导 AI 逆向工程工具。论文提出了 RARE 攻击,利用表示混淆让 AI 将数据误认为指令。通过 RARE-Bench 测试,研究者发现模型极易被植入的不安全动作误导。为此设计的 RARE-Guard 机制通过授权控制与证据验证,成功阻断了虚假声称。这为构建鲁棒的自动化逆向分析流水线提供了工程方案。 [link]
后量子加密虽然安全,却可能被 DDoS 攻击利用。在 TLS 1.3 中集成 PQC 会显著增加握手开销。实验表明,这种开销让服务器 CPU 高负载时间延长了 88 倍。同时,现有的入侵检测系统在 PQC 流量面前识别率大幅下降,部分模型甚至接近随机猜测。论文发布的混合流量数据集为开发下一代后量子感知防御系统提供了基准。 [link]
针对特定用途的 AI 智能体,传统的输入过滤难以应对复杂的提示注入攻击。PVDetector 无需额外训练,它通过分析大模型推理时的隐藏状态空间,捕捉潜在的政策违规概念。实验证明,模型内部其实能感知请求是否越权。该框架在保持极低误报率的同时,几乎不增加推理延迟。这种基于内在语义对齐的检测方案比外挂分类器更可靠。 [link]
大模型生成的代码漏洞往往成簇出现。研究者结合变态测试与关联规则挖掘,揭示了漏洞之间的共存规律。跨站脚本与弱加密漏洞通常预示着硬编码凭据的存在。通过分析 3700 段代码,发现 68.8% 的片段存在安全缺陷。这种结构化的风险分析有助于开发更智能的验证工具,能够从提示词层面干预不安全代码的生成。 [link]
代码究竟出自人类之手还是来自大模型?这一溯源问题关乎软件供应链的可信度。研究者利用公开情报开发出准确率高达 93% 的分类器。研究发现大模型在处理 OAuth 和 SQL 访问等任务时,会表现出与人类截然不同的安全模式。即便模型能修复已知漏洞,也往往在移除旧风险时忘记添加防御逻辑。这为代码审计提供了新的数据驱动视角。 [link]
深度学习入侵检测系统常因黑箱特性被分析师疏远。EXP-SEC 框架能将复杂的模型决策转化为符合安全运营中心语义的解释。它具备取证模块,可以隔离导致告警的可疑数据包,并处理网络流量中复杂的特征依赖。通过多级映射,晦涩的数学权重变成了分析师能看懂的领域术语。这极大提升了安全团队排查误报与应对真实威胁的效率。 [link]
强制更换密码时,用户往往只进行微小的变动。MindReader 利用大模型建议语义相关但拼写迥异的变体。这保证了密码容易记忆,同时也让攻击者难以预测。在用户研究中,这种方法生成的密码安全性显著优于用户自行创建的版本。即便攻击者知道原始密码和工具原理,也难以轻易破解。它在人类认知负担与系统安全性之间找到了平衡。 [link]
长期骨科护理涉及海量碎片化病历。传统系统难以实现持续管理。OrthoPilot 实现了突破。该系统利用大语言模型整合医院实时数据与权威外部知识。它能自主处理影像和实验室结果。在针对 1870 个复杂病例的前瞻性研究中,全链路管理成功率提升了 10.6%。病床周转率也显著增加。这标志着人工智能从单一事件预测转向全流程临床管理。 [link]
核电站人为因素诊断极度依赖专家经验。数据驱动方法往往缺乏逻辑一致性。研究者提出了 G-SHARE 框架。该框架将九步诊断指南转化为可审计的推理工作流。它包含证据提取和逻辑验证等阶段。实验采用中国核工业的真实报告。系统表现远超传统机器学习模型。这种将专家规则转化为推理流水线的做法,为高安全性行业的智能化转型提供了可靠路径。 [link]
企业级 SQL 生成对安全性要求极高。LLM 产生的输出必须严丝合缝地遵循访问控制策略。GRID 引擎通过语法约束解码解决了这一难题。它不再依赖单纯的 token 序列,而是基于解析器状态生成掩码。RBAC 策略被直接编译进语法。系统在 0.5B 模型上将准确率提升了 13 个百分点。它为数据主权下的模型部署提供了硬性保证。 [link]
企业 RAG 部署面临治理盲区。生成成本易统计,检索层成本却难以分担。这导致了多租户间的隐形交叉补贴。研究者推出了 Cost-Governed RAG 架构。该方案集成了 TurboVec 索引,实现了检索成本的精确归属。在云平台测试中,成本分担准确率高达 99.96%。它将检索设施成本降低了数倍。企业现在可以清晰地看到每个租户的每一笔资源开支。 [link]
强化学习是激发模型推理能力的关键。研究者成功将零样本强化学习扩展至 1T 参数规模。他们解决了大规模训练中的稳定性难题。Ring-2.5-1T-Zero 展示了惊人的涌现行为。它自发演化出了自我验证和并行推理等高级认知能力表。在七项数学评测中表现优异。这项研究证明了即便没有人类标注,规模效应依然能显著提升推理天花板。它提供了万亿级模型训练的系统级优化方案。 [link]
手机端 Agent 通常依赖复杂的 GUI 操作。这种方式效率低且界限模糊。PalmClaw 提供了一种全新的原生框架。它直接在手机端运行,将底层功能封装成带有明确参数的工具。这种设计让 Agent 能精准调取手机硬件能力。实验显示任务成功率提升了 11.5%。完成时间缩减了 94.9%。它放弃了盲目滑动屏幕的操作方式,转而通过结构化调用实现高效自动化。 [link]
现代 Agent 往往过度阅读文件。哪怕只是修改一行代码,也会审计整个代码库。这造成了严重的资源消耗。研究者提出了 E3 框架。Agent 会先预估任务难度,再以最小可行路径执行。如果验证失败才会扩大范围。在模拟器测试中,该方案在维持满分成功率的同时降低了 85% 的成本。它显著减少了 token 消耗。这种工程导向的思路让 Agent 运行更接近资深工程师的行为。 [link]
减少 token 并不等同于省钱。很多优化层只关注文本压缩率。研究者通过近 3000 次付费调用揭开了真相。他们发现提示词缓存流量才是成本核心。简单的工具输出压缩反而可能导致成本上升 6.8%。不当的压缩还会破坏代码修改的定位锚点,降低成功率。这项研究建议采用成功率调整后的计费成本作为衡量标准。它是对当前盲目追求压缩率趋势的重要纠偏。 [link]
互联网语料训练的模型不可避免地包含未来信息。这在金融 backtesting 中会导致严重的幸存者偏差。研究者构建了按日历日期过滤的训练流水线。他们训练了一系列涵盖 2013 至 2024 年的模型检查点。这些模型在 4B 规模下接近了同类领先模型的性能。它们从根本上杜绝了信息泄露。它为社会科学和金融领域的因果推断提供了严谨的实验底座。 [link]
MoE 模型在推理时存在严重的内存挑战。speculative decoding 通常只优化接受率,忽略了激活专家的成本。这会导致 expert scattering 现象。EcoSpec 引入了成本感知的投机解码。它在选择草案路径时会优先考虑已激活的专家。这种策略显著降低了内存带宽占用。在 DeepSeek-V3.1 等大型模型上实现了 1.62 倍的端到端提速。它让超大规模模型的实时部署变得更加经济高效。 [link]
CISA 周二发出警告,攻击者正积极利用三个漏洞入侵暴露在互联网上的本地 SharePoint Server 实例。 [link]
由于本月的 Windows 11 安全更新会导致设备关机并产生性能问题,微软正拦截部分 Dell 设备获取该更新。 [link]
美国联邦检察官公布了针对三名俄罗斯国民的指控。他们涉嫌为勒索软件团伙提供防弹托管服务,导致全球受害者损失超过 6200 万美元。 [link]
Intruder 开发了一个由 AI 驱动的漏洞贩卖机。该系统结合代码切片技术与 LLM 自动发现复杂的软件漏洞。公司解释了系统如何发现并利用未知的 WordPress 插件 zero-day 漏洞,另有部分发现已进入负责任披露流程。 [link]
五个恶意版本的 AsyncAPI 软件包被发布到 npm 仓库。这是一起供应链攻击,旨在植入具有信息窃取能力的远程访问木马。 [link]
一名代号为 bandcampro 的俄语攻击者将 Google 开源的 Gemini CLI AI 工具用作黑客代理,并以此运行一个小规模的 botnet。 [link]
Zoom 警告其 Windows 桌面客户端和 SDK 中存在一个关键漏洞。未经身份验证的第三方可能利用该漏洞接管账户。 [link]
荷兰警方宣布逮捕多名犯罪嫌疑人。这些人涉嫌参与跨国投资欺诈计划,导致数万名受害者损失超过 1 亿欧元。 [link]