网安 + AI 前沿日报

2026/5/16 · CyberRadar

网络安全论文

ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents

Seunghyun Lee, David Brumley · 2026/5/15

漏洞利用不只是崩溃那么简单。ExploitBench 建立了一套 16 级的评估阶梯,涵盖了从沙箱原语获取到任意代码执行的全过程。它在 41 个 V8 漏洞上对主流模型进行了实战测试。结果显示,虽然大多数模型能触发崩溃,但只有私有顶尖模型具备完成复杂利用的能力。这套工具为安全智能体的能力评估提供了客观的度量标尺,让攻防演练告别盲目测试。 [link]

Memory Forensics Techniques for Automated Detection and Analysis of Go Malware

Hala Ali, Andrew Case, et al. · 2026/5/15

Go 语言编写的恶意软件正在泛滥,但其静态编译和复杂的运行时让传统分析工具力不从心。这篇论文推出了首个针对 Go 二进制程序的内存取证框架。它能解析 Go 内部结构,重建堆内存中的字符串,并追踪协程栈信息。通过 ABI 感知的逆向分析,该框架成功从勒索软件中提取了加密密钥和指令服务器地址。这些运行时数据是静态分析无法触及的盲区。 [link]

Capacitive Touchscreens at Risk: A Practical Side-Channel Attack on Smartphones via Electromagnetic Emanations

Yukun Cheng, Changhai Ou, et al. · 2026/5/15

电磁泄露成了智能手机的新软肋。TESLA 攻击通过非接触式探测,捕获触摸屏扫描时产生的微弱电磁信号。这种信号编码了用户手指的运动轨迹。实验表明,即便不接触设备,攻击者也能以 99.3% 的准确率恢复解锁密码,甚至能还原用户的手写输入内容。该研究打破了现有侧信道攻击的物理限制,在会议室和图书馆等真实场景中展示了惊人的杀伤力。 [link]

PickleFuzzer: A Case Study in Fuzzing for Discrepancies Between Python Pickle Implementations

Justin Applegate, Andreas Kellas · 2026/5/15

Python 的序列化机制 pickle 潜伏着巨大的安全隐患。PickleFuzzer 利用差异化模糊测试,在不同的 PVM 实现之间挖掘逻辑不一致。它成功发现了 14 个新漏洞,其中 4 个能直接绕过 Hugging Face 等平台的安全扫描系统。这种基于语法的测试方法无需规格说明,仅靠对比执行行为就能定位深层缺陷。它提醒我们,基础库的细微实现差异足以瓦解整个供应链的防御。 [link]

Exploiting LLM Agent Supply Chains via Payload-less Skills

Xinyu Liu, Yukai Zhao, et al. · 2026/5/15

恶意软件不再需要携带代码载体。SCH 攻击利用智能体的生成特性,将攻击意图隐藏在自然语言格式的合规准则中。这种无载荷攻击能诱导编码助手自行生成并执行恶意指令,实现远程代码执行。在对主流框架的测试中,该攻击成功率高达 77% 以上,且现有的特征码扫描工具完全无法检测。这一发现迫使我们重新思考智能体插件的安全边界,将重心转向防御恶意意图。 [link]

MemLineage: Lineage-Guided Enforcement for LLM Agent Memory

Ciyan Ouyang, Rui Hou · 2026/5/15

恶意指令正通过第三方插件悄悄渗入智能体的长期记忆。MemLineage 引入了基于默克尔日志的溯源机制,为每一条记忆赋予加密凭证。它建立了一套推导谱系图,只有信任链完整的记忆才能驱动敏感操作。这种设计将内存保护转化为供应链追踪问题。实验证明,该方案在零性能开销的前提下,彻底阻断了所有内存投毒攻击。它为自主智能体的大规模部署打下了坚实的地基。 [link]

Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

Shuqiang Wang, Wei Cao, et al. · 2026/5/14

推理模型在遇到逻辑悖论时会陷入过度思考。HGA 框架利用遗传算法,自动生成能诱发模型冗余推理的干扰输入。测试发现,这些输入能让模型输出长度暴涨 26 倍,导致严重的推理延迟和资源耗尽。这种新型拒绝服务攻击具有极强的通用性,在不同规模的模型间表现出稳定的迁移能力。该研究警示开发者,高性能推理的背后隐藏着资源占用风险,亟需建立鲁棒的配额机制。 [link]

Do Coding Agents Understand Least-Privilege Authorization?

Zheng Yan, Jingxiang Weng, et al. · 2026/5/15

授予智能体多少权限才算安全?AuthBench 针对 120 个真实终端任务,系统评估了模型执行最小权限原则的能力。研究发现,简单的推理增强并不能解决过度授权的问题,模型往往会陷入特定的错误倾向。通过将策略生成拆解为覆盖度仿真和敏感度审计两个环节,该方案显著提升了授权的准确性。这套基准测试为构建受控的自动化编程环境提供了必要的验证手段。 [link]

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

Tri Cao, Yulin Chen, et al. · 2026/5/15

网页智能体极易被 HTML 中的指令注入带偏。WARD 针对 719 个高流量网站构建了大规模数据集,并引入了自适应对抗训练框架。它通过模拟攻击者与防御者的持续博弈,显著提升了模型对未知攻击模式的泛化能力。实验显示,该方案在保持高召回率的同时,几乎不增加额外的推理延迟。这让它成为首个能够在大规模网页浏览任务中平衡安全与效率的实用防御模型。 [link]

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

Haomin Zhuang, Hanwen Xing, et al. · 2026/5/15

恶意插件正在成为智能体生态的隐形炸弹。AgentTrap 是一套针对第三方技能的动态评测基准,涵盖了 16 个安全维度。它发现,模型往往在完成表面任务的同时,顺带执行了插件植入的恶意侧效。这种行为逃避了传统的越狱检测,只有在沙盒环境中进行全路径追踪才能识破其真面目。该研究填补了运行时安全评估的空白,为建立可信的插件市场提供了客观的评估依据。 [link]

AI 论文

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

Yucheng Guo, Yongjian Guo, et al. · 2026/5/14

具身智能领域迎来系统级突破。 D-VLA 框架解决了大规模 VLA 模型训练中的显存与带宽瓶颈。它通过 Plane Decoupling 技术实现数据与控制物理隔离,并引入四线程异步流水线。实验证明该框架在十亿级参数模型上表现优异,并在万亿级扩展测试中保持线性加速。它是构建通用具身智能体的坚实基座。 [link]

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Xiaohua Wang, Kai Yu, et al. · 2026/5/15

重复性任务不再是 Token 碎钞机。 LOOP Skill Engine 通过一次性记录加确定性重放模式,将 agent 成功率提升至 99% 并削减了 99% 的成本。该引擎利用长度递减模板提取算法,将 LLM 推理过程转化为参数化执行计划。后续任务无需调用模型,直接通过变量解析运行。它为周期性业务部署提供了极致的性价比。 [link]

Orchard: An Open-Source Agentic Modeling Framework

Baolin Peng, Wenlin Yao, et al. · 2026/5/15

Orchard 是一套面向大规模 agent 建模的开源框架,打破了闭源系统的垄断。它提供轻量级沙盒管理环境 Orchard Env,并针对代码开发、 GUI 操作和个人助手场景定制了训练方案。通过 credit-assignment SFT 和平衡自适应采样, Orchard 在多项 benchmark 中刷新了开源模型纪录。它让开发者能低门槛构建高性能智能体应用。 [link]

GraphBit: A Graph-based Agentic Framework for Non-Linear Agent Orchestration

Yeahia Sarker, Md Rahmat Ullah, et al. · 2026/5/15

针对 agent 工作流中常见的幻觉路由和死循环, GraphBit 引入了基于 Rust 引擎的确定性编排方案。它将任务定义为有向无环图,将 agent 抽象为类型化函数。其独特的三层存储架构有效防止了上下文膨胀引发的推理退化。在 GAIA 测试中,该框架在保持极低延迟的同时,实现了同类系统中的最高精度和吞吐量。 [link]

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

Anjir Ahmed Chowdhury, Syed Zawad, et al. · 2026/5/15

合成数据生成成本太高? MSIFR 框架提供了一种轻量级且无需训练的解决方案。它在推理过程中设置多个检查点,利用规则校验器及早识别并终止低质量的路径,从而避免在注定失败的样本上浪费 Token。实验显示该方法在保证准确率的同时,能节省高达 77% 的 Token 消耗。它是优化 LLM 数据流水线的实用利器。 [link]

Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning

Haozhe Wang, Qixin Xu, et al. · 2026/5/15

当 VLM 任务失败时,问题出在感知错误还是逻辑混乱? MoCA 机制通过解耦感知与推理步骤给出答案。它引入 Perception Verification 技术,利用盲读代理独立奖励感知忠诚度,避免了传统评测中两者互相干扰的跷跷板效应。该框架结合强化学习有效提升了多模态模型在复杂视觉任务中的表现,让模型看地更准、想地更深。 [link]

Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

Shuoyang Sun, Chang Da, et al. · 2026/5/15

投机采样加速技术竟然存在隐秘的安全漏洞。 Mistletoe 揭示了一种新型加速塌陷攻击。攻击者通过微小扰动诱导草稿模型与目标模型分布失配,在不改动输出语义的前提下,导致接受率断崖式下跌。这种针对推理机制而非内容的攻击方式,提醒我们在追求 LLM 推理性能时,必须重新审视加速架构的鲁棒性设计。 [link]

Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems

Ling Wang, Songnan Liu, et al. · 2026/5/15

企业级系统间的异构数据和复杂多步推理一直是 LLM 的禁区。 HEAR 引入分层超图本体,将业务规则和程序协议编码为超边。它构建了一个证据驱动的推理环路,动态编排本体工具完成自动化诊断,无需重新训练模型。在供应链阻碍根因分析中, HEAR 达到了 94.7% 的准确率,为企业级智能应用建立了可审计的基石。 [link]

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis

Yucheng Shi, Zhenwen Liang, et al. · 2026/5/15

让模型自己构建训练自己的世界。 EvoEnv 提出了一种环境构造循环,模型不再只是生成静态数据,而是编写可执行的 Python 环境来采样实例并验证答案。通过维持解决与验证之间的结构性不对称,该框架确保了奖励信号在模型持续进步时依然具有信息量。它在零数据场景下实现了稳定的自我演进,让模型能力跨越了预设的边界。 [link]

MMSkills: Towards Multimodal Skills for General Visual Agents

Kangning Zhang, Shuai Shao, et al. · 2026/5/14

视觉智能体需要更专业的技能包。 MMSkills 框架将可复用的程序性知识形式化,构建了耦合文本规程、运行状态卡片和多视角关键帧的技能包。通过 agentic 轨迹到技能生成器,它可以从公开交互记录中提炼出通用操作。在 GUI 和游戏基准测试中,该框架显著增强了多模态模型在实时决策中的表现,补齐了模型内部先验的短板。 [link]

BleepingComputer 新闻

TeamPCP hackers advertise Mistral AI code repos for sale

Ionut Ilascu · 2026/5/15 6:50

TeamPCP 骇客组织威胁要泄露 Mistral AI 项目的源代码,除非能为这些数据找到买家。 [link]

Microsoft warns of Exchange zero-day flaw exploited in attacks

Sergiu Gatlan · 2026/5/15 17:40

微软在周四分享了针对 Exchange Server 高危漏洞的缓解方案。该漏洞已被用于攻击,攻击者能通过 XSS 在针对 Outlook 网页版用户时执行任意代码。 [link]

Microsoft to automatically roll back faulty Windows drivers

Sergiu Gatlan · 2026/5/15 20:29

微软推出了一项新功能,支持远程回滚通过 Windows Update 分发的有问题的驱动程序。 [link]

Microsoft backpedals: Edge to stop loading passwords into memory

Sergiu Gatlan · 2026/5/15 22:49

微软正在更新 Edge 浏览器,确保启动时不再将保存的密码以明文形式加载到进程内存中。此前微软曾声称这是设计使然。 [link]

Inside the REMUS Infostealer: Session Theft, MaaS, and Rapid Evolution

Sponsored by Flare · 2026/5/15 22:02

被盗的浏览器会话和 token 变得比密码更有价值。Flare 解释了 REMUS 窃信软件如何围绕会话窃取和操作可扩展性进行演进。 [link]

Popular node-ipc npm package compromised to steal credentials

Bill Toulas · 2026/5/16 1:10

骇客在 node-ipc 的新版本中植入了凭据窃取恶意软件。这是一次针对 npm 的供应链攻击,node-ipc 是一个流行的进程间通信包。 [link]

Avada Builder WordPress plugin flaws allow site credential theft

Bill Toulas · 2026/5/15 23:56

WordPress 的 Avada Builder 插件存在两个漏洞。该插件拥有约 100 万活跃安装量。骇客可以利用这些漏洞读取任意文件并从数据库中提取敏感信息。 [link]

Microsoft Exchange, Windows 11 hacked on second day of Pwn2Own

Sergiu Gatlan · 2026/5/16 1:47

在 Pwn2Own 柏林 2026 的第二天,参赛者利用了包括 Windows 11、Microsoft Exchange 以及 Red Hat Enterprise Linux 在内的多个产品中的 15 个 zero-day 漏洞,共获得 385,750 美元奖金。 [link]

Funnel Builder WordPress plugin bug exploited to steal credit cards

Bill Toulas · 2026/5/16 3:30

WordPress 的 Funnel Builder 插件中一个严重漏洞正被利用。攻击者借此向 WooCommerce 结账页面注入恶意 JavaScript 代码片段。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/5/15 7:15 至 2026/5/16 7:26