网络安全论文
Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents
Abhinaba Basu · 2026/3/12
AI 智能体执行任务时经常产生幻觉,伪造工具调用结果。传统的 ZKP 验证耗时过长,难以在交互场景应用。NabaOS 提出一种轻量级框架,为工具调用生成不可篡改的 HMAC 签名收据。实验证明,该方案能检测出 94.2% 的伪造引用,且运行开销不足 15 毫秒。它让智能体在保障响应速度的同时,获得了接近密码学强度的真实性校验。 [link]
Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities
Nanzi Yang, Weiheng Bai, et al. · 2026/3/12
MCP 正在成为 AI 智能体连接外部工具的通用标准。由于协议为了兼容性放松了约束,开发者实现 SDK 时极易埋下安全隐患。这项研究首次对多语言 MCP SDK 进行了系统性安全审计。研究者利用 LLM 指导的语义推理分析合规性,发现了静默提示词注入等多种攻击路径。这是对智能体生态关键基础设施的一次重要体检,为构建更安全的插件体系提供了指导。 [link]
Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors
Ailiya Borjigin, Igor Stadnyk, et al. · 2026/3/12
当 LLM 意图转化为特权执行,智能体交易系统面临巨大的风险。即使是良性的提示词,也可能因为环境偏差引发无法挽回的财务损失。SAE 框架作为一种执行层中间件,在最后一公里强制执行风险控制。通过曝光预算、滑点限制和分阶段执行,该系统在实测中将最大回撤从 0.4643 降低到 0.0319。它重新定义了智能体交易的安全基准,让自动化的金融操作更加稳健。 [link]
AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations
Yu He, Haozhe Zhu, et al. · 2026/3/12
间接提示词注入是 LLM 智能体的致命威胁。攻击者将恶意指令隐藏在工具输出中从而劫持执行流程。AttriGuard 提出一种基于因果归因的防御新范式。它在运行时通过并行反事实测试,验证每一次工具调用的必要性。只有当调用真正符合用户原始意图,且排除不可信观察的干扰时,动作才会被准许。该方案跳出了语义识别的怪圈,在面对自适应攻击时表现出极强的韧性。 [link]
Targeted Bit-Flip Attacks on LLM-Based Agents
Jialai Wang, Ya Wen, et al. · 2026/3/12
硬件故障也能精准重创 LLM 智能体。Flip-Agent 揭示了针对 Agent 系统的首个定向比特翻转攻击。攻击者利用硬件漏洞篡改模型参数,在改变最终输出的同时精准操纵工具调用。实验表明,这种攻击在现实任务中展现出惊人的成功率。相比单步推理模型,拥有多阶段流水线的智能体暴露出了更复杂的攻击面。这项研究提醒开发者,构建安全边界必须从软件层延伸到物理硬件层。 [link]
Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference
Fan Yang · 2026/3/12
具备思考模式的 LLM 虽然推理能力更强,却引入了独特的安全风险。Multi-Stream 攻击利用多任务交织策略,成功绕过了 DeepSeek 和 Qwen3 等主流模型的安全对齐。通过在单个提示词中植入互相干扰的任务流,攻击者能诱导模型在思考中发生逻辑崩溃,进而输出违规内容。该手段在多个基准测试中表现卓越。它揭示了长链推理模型在处理并发任务时的脆弱性,为安全加固提供了新思路。 [link]
CacheSolidarity: Preventing Prefix Caching Side Channels in Multi-tenant LLM Serving Systems
Panagiotis Georgios Pennas, Konstantinos Papaioannou, et al. · 2026/3/12
为了提升效率,LLM 服务商普遍采用前缀缓存技术。然而这种共享机制在多租户环境下会泄露隐私。攻击者可以通过观察推理延迟,逆向推测其他用户的敏感数据。CacheSolidarity 成功化解了性能与安全的矛盾。它通过监控跨用户缓存重用,精准识别并隔离可疑前缀。相比直接禁用缓存的方案,它将重用率提升了 70%,且延迟更低。这为高并发云端模型服务的安全合规铺平了道路。 [link]
Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?
Chaoyuan Peng, Lei Wu, et al. · 2026/3/12
AI 智能体真的能取代人类进行智能合约审计吗?这篇论文对 EVMBench 进行了冷思考。研究者引入了模型训练截止日期之后的真实安全事件,测试了 26 种不同配置。结果显示,现有 Agent 虽有进展,但无法完成端到端的利用。一旦缺乏人类提供的上下文,表现就会大幅下滑。研究结论非常务实,目前 AI 适合作为辅助审计工具,人类专业判断在现阶段依然不可或缺。 [link]
OAuthHub: Mitigating OAuth Data Overaccess through a Local Data Hub
Qiyu Li, Yuhe Tian, et al. · 2026/3/12
谷歌和微软提供的 OAuth 授权往往过于粗略。第三方应用为了运行,不得不请求超出必要的隐私权限。OAuthHub 框架利用用户的个人设备作为中间控制器,打破了这种僵局。开发者只需声明数据访问意图,即可实现精细化授权。评估结果显示,使用该框架编写代码比传统 API 快一倍,且代码量显著减少。它在几乎不增加运行开销的前提下,从架构层面根治了数据过度访问的顽疾。 [link]
Silent Subversion: Sensor Spoofing Attacks via Supply Chain Implants in Satellite Systems
Jack Vanlyssel, Gruia-Catalin Roman, et al. · 2026/3/12
卫星遥测一旦被操纵,航天任务将面临灭顶之灾。传统的欺骗攻击多来自地面,但这篇论文揭示了供应链植入这一隐蔽威胁。研究者在 NASA 模拟环境中演示了内生性欺骗攻击,恶意组件生成的假数据包能直接误导导航并掩盖硬件故障。论文讨论了组件认证和轻量级监测方案。这为保障太空基础设施完整性提供了关键洞察,是安全研究向高精尖领域延伸的典范。 [link]
AI 论文
Aligning Large Language Models with Searcher Preferences
Wei Wu, Peilun Zhou, et al. · 2026/3/12
搜索 推荐 系统 的 范式 正 从 排序 向 回答 生成 转变。SearchLLM 作为 首个 面向 开放 域 生成 式 搜索 的 模型,解决 了 检索 噪声、安全 保障 与 用户 需求 对齐 等 多重 挑战。它 通过 多维 奖励 系统 与 GRPO 算法 实现 优化。在 小红书 真实 业务 场景 的 测试 中,该 模型 显著 提升 了 用户 参与度 并 降低 了 重搜率。它 为 构建 可靠 且 个性化 的 智能 搜索 入口 提供 了 工业 级 实践 参考。 [link]
OpenClaw-RL: Train Any Agent Simply by Talking
Yinjie Wang, Xuyang Chen, et al. · 2026/3/12
现有 的 智能体 系统 往往 忽略 了 交互 过程 中 的 状态 信号。OpenClaw-RL 提出 一种 在线 学习 框架。它 将 用户 回复、工具 输出 和 终端 状态 变化 视为 通用 的 学习 来源。该 系统 利用 进程 奖励 模型 提取 标量 信号,并 结合 事后 引导 的 策略 蒸馏 进行 优化。它 支持 异步 并行 训练,让 智能体 在 实际 使用 中 不断 进化。这种 无需 人工 干预 的 自我 迭代 机制 极大 地 降低 了 模型 维护 成本。 [link]
IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs
Chuan Guo (Michael Pokorny), Juan Felipe Ceron Uribe (Michael Pokorny), et al. · 2026/3/12
当 系统 指令 与 用户 指令 冲突 时,模型 往往 会 陷入 混乱。OpenAI 团队 推出 的 IH-Challenge 旨在 增强 模型 对 指令 层级 的 理解 能力。通过 在线 对抗 样本 生成 和 强化 学习,GPT-5-Mini 在 防范 越狱、系统 提示词 提取 及 提示词 注入 方面 表现 出色。该 研究 减少 了 模型 的 不安全 行为,且 保持 了 原本 的 通用 能力。它 为 构建 具有 可信 优先级 策略 的 智能体 提供 了 关键 的 数据集 支持。 [link]
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
Wenjing Zhang, Jiangze Yan, et al. · 2026/3/12
从 大型 推理 模型 向 小 模型 蒸馏 能力 时,静态 过滤 往往 会 导致 性能 瓶颈。HEAL 框架 引入 了 近 侧 发育 区 理论。它 通过 检测 推理 断点 并 注入 提示 来 修复 失败 的 轨迹。利用 复杂度 与 不确定性 比值 评估器,该 方法 能 有效 过滤 虚假 快捷 方式,确保 学生 模型 习得 真实 的 认知 突破。实验 证明,这种 课程 演化 策略 在 多个 推理 基准 测试 中 超越 了 传统 的 SFT 蒸馏,打破 了 教师 模型 的 性能 上限。 [link]
Safe and Scalable Web Agent Learning via Recreated Websites
Hyungjoo Chae, Jungsoo Park, et al. · 2026/3/12
在 真实 网站 上 训练 网页 智能体 既 不安全 又 难以 量化。VeriEnv 框架 利用 语言 模型 自动 克隆 现实 网站,将 其 转化 为 完全 可 执行 且 可 验证 的 合成 环境。它 通过 Python SDK 提供 内部 访问 权限,允许 智能体 自主 生成 带有 确定性 奖励 的 任务。这种 设计 让 学习 过程 与 真实 交互 解耦,支持 训练 规模 的 无限 扩展。实验 表明,在该 环境 下 训练 的 智能体 具备 极强 的 泛化 能力,能 轻松 胜任 未 见过 的 复杂 网页 任务。 [link]
Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent
Zhongzhen Huang, Yan Ling, et al. · 2026/3/12
临床 诊断 要求 AI 具备 深厚 的 专业 背景 与 严谨 的 推理 逻辑。PULSE 智能体 将 领域 调优 后 的 模型 与 科学 文略 检索 相 结合。在 真实 内分泌 病例 的 对比 实验 中,其 表现 达到 了 资深 专家 的 水平。与 人类 医生 不同,它 对 罕见 病 的 识别 准确率 保持 稳定,并 能 根据 任务 难度 自适应 地 增加 推理 时长。该 研究 揭示 了 协作 流 中 自动化 偏差 的 风险,也 为 语言 模型 进入 辅助 诊疗 领域 铺平 了 道路。 [link]
Hybrid Self-evolving Structured Memory for GUI Agents
Sibo Zhu, Wenyi Wu, et al. · 2026/3/12
处理 长 流程 计算机 任务 时,GUI 智能体 常 因 缺乏 结构化 记忆 而 犯错。HyMEM 受到 人脑 启发,构建 了 一种 耦合 符号 节点 与 轨迹 嵌入 的 图 结构 记忆 系统。它 支持 多 跳 检索 和 实时 工作 记忆 更新。通过 在 推理 过程 中 动态 刷新 知识,该 框架 显著 增强 了 开源 模型 的 性能。即便 是 7B 级别 的 模型,在 配备 此 记忆 系统 后,其 表现 也能 比肩 甚至 超越 GPT-4o 等 闭源 大 模型。 [link]
SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks
Srivatsa Kundurthy, Clara Na, et al. · 2026/3/12
操控 复杂 的 电子 表格 是 办公 自动化 的 核心 难题。SpreadsheetArena 提供 了 一个 端 到 端 生成 的 评估 平台,通过 盲测 对 模型 生成 的 工件 进行 两两 比对。研究 发现,虽然 头部 模型 在 排行榜 上 名列前茅,但在 处理 金融 等 专业 领域 的 表格 时,仍 难以 符合 行业 最佳 实践。该 平台 揭示 了 模型 在 交互 逻辑 与 布局 设计 上 的 短板。它 定义 了 多维度 的 评价 准则,并 为 研发 实用 的 自动化 办公 助手 提供 了 基准 指标。 [link]
GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
Zhouxiang Fang, Jiawei Zhou, et al. · 2026/3/12
针对 特定 任务 的 微调 往往 会 无意中 破坏 预训练 模型 原有 的 安全 对齐。GR-SAP 借鉴 持续 学习 中 的 生成 重放 思想,在 不 接触 原始 对齐 数据 的 情况 下,利用 模型 自身 合成 领域 内 的 安全 数据。通过 在 微调 过程 中 混合 这些 合成 数据,它 有效 抑制 了 安全性 的 退化。实验 证明 该 方案 在 保持 下游 任务 性能 的 同时,显著 降低 了 模型 输出 有害 信息 的 风险。它 为 开发者 提供 了 一种 既 轻量 又 高效 的 安全 加固 方案。 [link]
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
Sudipta Ghosh, Mrityunjoy Panday · 2026/3/12
模型 是否 知道 自己 不 知道?这项 研究 深入 探讨 了 大 语言 模型 中 的 达克 效应。研究者 通过 24,000 次 实验 发现,性能 较差 的 模型 往往 表现 出 严重 的 过度 自信,其 校准 误差 惊人。相比 之下,性能 卓越 的 模型 在 评估 自身 能力 时 更加 客观。这一 发现 为 高 风险 场景 下 的 模型 部署 敲响 了 警钟。它 强调 了 信心 校准 在 安全性 评估 中 的 核心 地位,促使 研究者 开发 更 真实 的 评估 机制。 [link]
BleepingComputer 新闻
US charges another ransomware negotiator linked to BlackCat attacks
Sergiu Gatlan · 2026/3/12 19:31
美国司法部起诉了又一名 DigitalMint 前员工。此人涉及一项内部计划,勒索软件谈判人员在该计划中秘密与 BlackCat 勒索软件组织合作。 [link]
Apple patches older iPhones and iPads against Coruna exploits
Sergiu Gatlan · 2026/3/12 21:43
Apple 发布安全更新,修复旧款 iPhone 和 iPad 的一系列漏洞。Coruna 漏洞利用工具包曾利用这些漏洞进行网络间谍和加密货币窃取攻击。 [link]
Telus Digital confirms breach after hacker claims 1 petabyte data theft
Lawrence Abrams · 2026/3/12 22:40
加拿大业务流程外包巨头 Telus Digital 确认发生安全事件。攻击者声称在持续数月的入侵中从该公司窃取了近 1 PB 数据。 [link]
Going the Extra Mile: Travel Rewards Turn into Underground Currency.
Sponsored by Flare · 2026/3/12 22:05
被盗的航空里程被兑换为机票和酒店住宿,随后作为折扣旅游产品转售。Flare 展示了网络罪犯如何将忠诚度账户视作可交易货币。 [link]
Google paid $17.1 million for vulnerability reports in 2025
Sergiu Gatlan · 2026/3/12 23:22
Google 在 2025 年通过其漏洞奖励计划向 747 名安全研究人员支付了超过 1700 万美元,用于奖励他们报告的安全漏洞。 [link]
US disrupts SocksEscort proxy network powered by Linux malware
Bill Toulas · 2026/3/13 0:19
美国和欧洲执法部门联手捣毁了 SocksEscort 代理网络。该网络利用被 AVRecon 恶意软件感染的 Linux 边缘设备构建而成。 [link]
Veeam warns of critical flaws exposing backup servers to RCE attacks
Sergiu Gatlan · 2026/3/13 0:59
数据保护公司 Veeam Software 修复了 Backup & Replication 方案中的多个缺陷,其中包括 4 个关键的 RCE 漏洞。 [link]
AI-generated Slopoly malware used in Interlock ransomware attack
Bill Toulas · 2026/3/13 4:01
新型恶意软件 Slopoly 可能由生成式 AI 工具创建。在一次 Interlock 勒索软件攻击中,攻击者利用它在受损服务器上潜伏超过一周并窃取数据。 [link]
England Hockey investigating ransomware data breach
Bill Toulas · 2026/3/13 4:37
英格兰曲棍球协会正在调查潜在的数据泄露事件。AiLock 勒索软件组织已将其列入数据泄露网站的受害者名单。 [link]
Canadian retail giant Loblaw notifies customers of data breach
Bill Toulas · 2026/3/13 5:32
出于极度谨慎的考虑,Loblaw 表示已自动注销所有客户的账户。用户需要重新登录才能访问该公司的数字服务。 [link]