Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
RLVR 显著提升了 LLM 推理能力,但其奖励校验机制潜藏漏洞。研究者通过注入少量中毒数据,利用不对称奖励信号诱导模型生成有害响应。这种攻击无需修改校验器即可植入,且跨模型规模表现出极强泛化性。激活后安全性能平均下降 73 %,且不损害正常任务表现。这一发现警示我们在追求推理极限时,必须审视强化学习框架的底层安全性。 [link]
2026/4/15 · CyberRadar
RLVR 显著提升了 LLM 推理能力,但其奖励校验机制潜藏漏洞。研究者通过注入少量中毒数据,利用不对称奖励信号诱导模型生成有害响应。这种攻击无需修改校验器即可植入,且跨模型规模表现出极强泛化性。激活后安全性能平均下降 73 %,且不损害正常任务表现。这一发现警示我们在追求推理极限时,必须审视强化学习框架的底层安全性。 [link]
LLM Agent 频繁调用外部工具,这让间接提示词注入攻击有机可乘。攻击者将恶意指令藏在检索内容中,诱导 Agent 执行非授权操作。PlanGuard 方案主打上下文隔离,引入独立的 Planner 生成参考动作集。其分层验证机制结合了硬性约束与意图校验,在实验中将攻击成功率从 72.8 % 降至 0 %。这种不依赖训练的防御策略,为 Agent 在真实世界的部署提供了坚实的运行期保护。 [link]
苹果 AirTag 依赖 Find My 网络实现定位,但其加密设计导致苹果无法验证位置报告的真实性。研究人员演示了一种实战级别的中继攻击,能向系统注入伪造的位置报告。这种手段能让物主收到虚假坐标,也能实施定向拒绝服务攻击,让丢失物品彻底无法被找回。该研究精准切中了物联网隐私保护与身份验证之间的权衡缺陷,为这类消费级定位设备的协议改进提供了有力依据。 [link]
单次指令被拦截后,攻击者转向了更隐蔽的多轮对话。萨拉米切片风险通过串联一系列看似无害的低风险输入,绕过对齐阈值,最终累积成高风险行为。基于此开发的 Salami Attack 框架在 GPT-4o 和 Gemini 上达到了 90 % 以上的成功率。这种攻击方式对上下文依赖较低,具备更强的通用性。研究同时提出了相应的防御策略,为构建鲁棒的 LLM 安全防线提供了新视角。 [link]
隐私计算受困于 FHE 效率低和 MPC 通信大的难题。EncFormer 提出阶段兼容模式,减少了密文打包与转换频率。配合 GPU 优化,该框架在模型推理中实现了最高 30.4 倍的通信量降幅,延迟缩减达 9.8 倍。这标志着隐私推理正向实用化迈进。它在保持接近明文精度的同时,为处理敏感数据提供了安全高性能的基座。 [link]
现有的 Agent 安全评估多针对恶意指令,却忽略了良性指令下的执行隐患。OS-BLIND 基准测试显示,即便用户意图完全合法,Agent 在处理环境嵌入威胁时仍有极高概率执行有害动作。Claude 4.5 Sonnet 在该测试中的攻击成功率达 73 %,在多代理系统中甚至飙升至 92.7 %。这揭示了 Agent 安全防御的巨大盲区,目前的对齐技术在任务执行阶段往往失效,亟需针对性的动态防护机制。 [link]
传统的越狱手段多停留在提示词工程,而 HMNS 深入到了模型电路层面。它通过识别对默认行为起关键作用的注意力头,并结合零空间转向技术注入扰动,实现了极高的攻击成功率。这种方法采用探测与干预的闭合迭代,只需少量查询即可击穿多重安全屏障。作为首个利用几何感知和可解释性干预的越狱框架,它展示了模型转向的新范式,同时也对大模型底层安全对齐提出了严峻挑战。 [link]
社交网络 Deepfake 往往经过多轮编辑,单一检测技术已力不从心。SEED 建立了大规模顺序溯源基准,涵盖 9 万张经多次篡改的图像。研究发现空间域特征在多轮编辑伪影面前表现不佳,而频域信号更可靠。为此提出的 FAITH 模型融合空间与小波分量,显著提升了编辑顺序预测精度。这为打击虚假信息和数字取证提供了精细工具。 [link]
AI Agent 自动支付资源时,HTTP 请求中的元数据往往泄露个人隐私。presidio-hardened-x402 作为首个开源中间件,在支付请求发出前进行拦截。它结合正则与 NLP 技术检测并脱敏 PII 数据,同时强制执行支出策略。该工具在极低的延迟开销下实现了 0.894 的 F1 分数。随着 Agent 经济兴起,这种兼顾隐私保护与合规审计的基础设施,将成为 Agent 商业化进程中不可或缺的安全组件。 [link]
LLM Agent 的记忆模块和 RAG 机制正成为隐私泄露的新温床。ADAM 攻击利用自适应查询技术,通过估计受害者 Agent 内存中的数据分布,配合熵引导策略最大化隐私提取效率。实验证明该方法在多个场景下达到了 100 % 的攻击成功率,远超现有水平。这一极端的安全风险凸显了保护 Agent 长期记忆的迫切性。研究展示了攻击的系统性,也为开发更稳固的隐私保护型 RAG 管道指明了改进方向。 [link]
ByteDance 部署 10 个月的实战系统。它在故障发生时响应,并全程嵌入客户与工程师的对话。系统通过持续自改进机制从人类案例中提取知识。在云服务支撑等高压场景下,Vigil 显著降低人力负担。该主动智能架构展示了 Agent 在工业级运维中从被动到主动的范式演进。 [link]
这是医疗影像分割领域的全自动科研系统。它将原始数据直接转化为具备文献支撑的研究提案并执行实验。在针对 2025 年新发表论文的测试中,Camyla 在多数数据集上超越了 nnU-Net。系统融合了分支探索与反射记忆机制,解决了科研中的目标漂移难题。它证明 AI 驱动的自主发现已达到顶刊审稿水平。 [link]
小模型在生产环境中落地的最大障碍是复杂的工程闭环。Pioneer Agent 实现了数据筛选、失败诊断与回归控制的全流程自动化。它在冷启动任务中自动构建评测集,并根据反馈优化超参数。针对已部署模型的报错,它能精准识别错误模式并定向增强。该框架为 SLM 的进化提供了标准化路径,显著提升了鲁棒性。 [link]
医疗行政每年耗资上万亿美元。这项研究针对预授权、申诉管理等真实工作流构建了包含 EHR 和支付门户的 GUI 模拟环境。研究发现当前顶尖 Agent 在端到端任务中的成功率不足 40 %。通过分解 1698 个验证点,它精准定位了长程操作中的瓶颈。这为 AI 进入医疗后端核心业务提供了严谨的评测基准。 [link]
为了在人类社交生态中生存,手机 GUI 智能体必须具备反检测能力。研究者将此建模为 Detector 与 Agent 之间的 MinMax 优化问题。采集真实的人类触摸动态数据后,AHB 基准测试揭示了传统 LMM 在操作动力学上的不自然。该研究提出的行为匹配方法,让智能体在维持效能的同时,实现了极高的仿生度与隐蔽性。 [link]
自动化审稿需具备可审计性。DeepReviewer 2.0 产出包含锚定标注、证据定位与可执行随访建议的完整报告。它在 ICLR 2025 投稿的盲测中击败了人类审稿委员会,覆盖了更多核心缺陷。通过构建权利证据风险账本,该系统将黑盒推理转变为逻辑严密的审核流程,是科研辅助工具的重要里程碑。 [link]
发现具备预测力的 Alpha 因子是量化金融的核心难题。Hubble 利用 LLM 作为智能启发式搜索工具,结合 AST 沙盒确保执行安全。系统通过跨截面 RankIC 与投资组合换手率等严苛指标,在美股实测中实现了 100 % 的计算稳定性。这种闭合因子挖掘框架克服了遗传算法的弊端,为自动科学发现提供了可复现的工程范式。 [link]
现有手机 Agent 评测过度依赖系统级 API,无法兼容闭源第三方应用。MobiFlow 通过多轨迹融合算法构建轨迹图,实现了对真实场景状态空间的有效压缩。它涵盖 20 个流行应用与 240 项复杂任务,评测信号与人类判断高度一致。该框架通过解决真实负载下的评估失准问题,为训练更具实用价值的手机操作模型指明了方向。 [link]
监管合规与临床分诊需要严谨的决策架构。Cognitive Core 抛弃了对话式指令,改用 9 种预定义的认知原语。它内置基于 SHA-256 散列链的防篡改审计账本,将人类复核设为执行前置条件。在预授权申诉测试中,该架构消除了所有静默错误,准确率远超 ReAct 模式。这种治理内生化设计,填补了 Agent 走向高风险决策的空白。 [link]
科学发现正在从知识检索转向执行具体科研工作。LABBench2 包含近 1900 个生物学研究任务,将评估重心移向真实科研场景。实验证明前沿模型在此基准上的准确率大幅下降,暴露出在现实生物学脉络下推理的不足。作为生物学领域的事实标准评测集,它为衡量 AI 系统执行复杂科学实验的能力提供了关键标尺。 [link]
被盗凭据仍是主要的攻击向量,经常导致不受控的权限提升。Specops 解释了以身份为中心的 Zero Trust 如何限制访问,强制执行设备信任并阻止横向移动。 [link]
Apple App Store 中一款伪造的 macOS 版 Ledger Live 应用在本月短短几天内,从 50 名受害者手中窃取了约 950 万美元的加密货币。 [link]
微软推出了快速通道流程,帮助开发者重新获得被 Windows Hardware Program 挂起的账户访问权限。此前由于许多开发者在未收到警告的情况下被锁定账户,引发了广泛投诉。 [link]
微软发布了适用于 25H2/24H2 和 23H2 版本的 Windows 11 累积更新 KB5083769 和 KB5082052。这些更新修复了安全漏洞和错误,并增加了新功能。 [link]
微软发布了 2026 年 4 月的 Patch Tuesday 安全更新。本次更新修复了 167 个缺陷,其中包括 2 个 zero-day 漏洞。 [link]
微软发布了 Windows 10 扩展安全更新 KB5082200。该更新修复了 2026 年 4 月 Patch Tuesday 的漏洞,其中包括 2 个 zero-day 漏洞。 [link]
教育公司 McGraw-Hill 在发给 BleepingComputer 的声明中确认,黑客利用 Salesforce 的配置错误访问了其内部数据。 [link]
Chrome Web Store 官方商店中有超过 100 个恶意扩展程序试图窃取 Google OAuth2 Bearer token,部署后门并实施广告欺诈。 [link]
微软引入了新的 Windows 保护措施,防御滥用 Remote Desktop 连接文件的网络钓鱼攻击。新措施增加了警告提示,并默认禁用有风险的共享资源。 [link]
加密货币交易所 Kraken 宣布一个网络犯罪组织正试图勒索该公司。对方威胁要发布展示托管客户数据的内部系统的视频。 [link]