网安 + AI 前沿日报

2026/5/28 · CyberRadar

网络安全论文

Batch Me If You Can: Coverage-guided RPKI Fuzzing at Scale

Haya Schulmann, Niklas Vogel · 2026/5/27

RPKI 软件的安全直接关系到全球互联网路由的稳定性。传统 Fuzzer 难以处理 RPKI 仓库复杂的逻辑依赖。CAT 框架引入持续采样与函数侧信道技术。它在多个验证器中挖掘出 21 个未知漏洞并获得 8 个 CVE 编号。该工具吞吐量提升了 66 倍且覆盖路径更广。它是保障互联网核心基础设施稳定的工程利器。 [link]

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

Hwiwon Lee, Jiawei Liu, et al. · 2026/5/27

现有的安全基准测试往往依赖特定描述或简单复现任务。SEC-bench Pro 直接挑战 V8 和 SpiderMonkey 等高复杂度系统。它通过三阶段流水线构建了包含 183 个真实漏洞的验证环境。实验发现顶尖 Agent 在这些长周期任务下的成功率不足 40%。这套基准为评估安全 Agent 的实战能力提供了严苛的炼金石。 [link]

Sandlock: Confining AI Agent Code with Unprivileged Linux Primitives

Cong Wang, Yusheng Zheng · 2026/5/27

在开发者机器上运行模型生成的 Shell 命令存在巨大风险。Sandlock 利用非特权 Linux 原语构建了轻量级沙箱。它将静态策略编译为内核规则并辅以窄监管器。该系统启动开销仅为 5 毫秒且几乎不损耗 Redis 吞吐性能。它在不需要 Root 权限的情况下实现了文件系统与网络的细粒度控制。 [link]

ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation

Xiaochong Jiang, Shiqi Yang, et al. · 2026/5/27

Agent 在组合使用 API 时常会出现权限洗白问题。即便单次调用合规,链式组合也可能导致机密泄露。ChainCaps 提出单调能力衰减机制。通过透明的 MCP 代理,它能确保数据在工具链中流动时权限只减不增。该方案在多款模型上将攻击成功率降至 5% 以下。它在保持业务连续性的同时堵住了权限蔓延的漏洞。 [link]

Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control

Zhe Yu, Wenpeng Xing, et al. · 2026/5/27

RAG 系统存在严重的监控控制缺口。模型能察觉证据中的矛盾却依然会执行中毒后的指令。Cordon-MAS 引入信息流控制原理。它通过隔离证据提取与答案合成的 Agent 权限来解决该问题。在多个基准数据集上,该方案让攻击成功率骤降了 92.4%。这为构建安全的检索增强生成系统提供了清晰的架构范式。 [link]

CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly

Yihe Fan, Changyi Li, et al. · 2026/5/27

现有的网络安全 Agent 往往受限于人类设计的固定框架。CyberEvolver 实现了架构的自我进化。它能根据失败尝试的日志自动修正自身的执行逻辑。通过四层演化架构与种群搜索策略,它在 CTF 和渗透测试中表现出色。其实际成功率比人类设计的 Agent 提升了 13.6%。这展示了自主化安全工具的进化潜力。 [link]

Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents

Peiran Wang, Ying Li, et al. · 2026/5/27

针对 Agent 的间接提示注入攻击防不胜防。AuthGraph 提出双图对齐防御方案。它构建推理图来追踪实际执行轨迹并构建授权图来模拟纯净上下文。通过结构化比对两者的偏差,它能精准识别参数源级别的违规操作。在 GPT-4o 上的实验证明它能将攻击成功率从 40% 压制到 1%。该框架实现了精细化的注入检测。 [link]

Resolving the Correct Library: A Loader-Level Defense Solution Against Shared Object Hijacking

Can Ozkan, Dave Singelee · 2026/5/27

共享库劫持一直是 Linux 生态的安全软肋。现有防御多关注文件完整性却忽略了加载器的解析路径。该研究认为劫持本质上是解析真实性问题。作者在 glibc 中实现了加载器级别的验证框架。它支持路径绑定与基于哈希的身份校验。该方案在通用及嵌入式 Linux 场景下均展现了极强的防御能力。这是对系统加载机制的重要加固。 [link]

MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems

Haobo Zhang, Xutao Mao, et al. · 2026/5/26

Agent 的长期内存快照一旦泄露就难以追踪其来源。MemMark 将所有者控制的信号嵌入到潜在的内存写入决策中。它利用加密承诺让归因依赖于可复现的后端行为。在 LoCoMo 任务中,该方案成功恢复了 40 bit 负载且对模型性能几乎无损。它为 Agent 内存系统的版权保护和行为审计开辟了高效的工程路径。 [link]

MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning

Xuanye Zhang, Yongsen Zheng, et al. · 2026/5/27

传统的工具劫持攻击主要修改元数据且易被审计。MemMorph 另辟蹊径,通过投毒长期内存来隐蔽地控制 Agent。它注入少量看似事实的记录来重塑 Agent 的感知。实验显示仅需三条记录就能达到 85.9% 的攻击成功率。这一发现暴露了工具增强型 Agent 在内存安全维度上的巨大隐患。该研究迫切呼吁建立内存完整性保护机制。 [link]

AI 论文

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

Rui Meng, Bhavana Dalvi Mishra, et al. · 2026/5/27

AI 科学家产出的论文常伴随引文造假或实验不可重复等问题。 ScientistOne 提出 Chain-of-Evidence 框架,通过构造时验证确保每一项结论都可溯源。在医学影像和语言建模等复杂任务中,它不仅消除了幻觉引用,还达到甚至超过了人类专家水平。该系统通过链式证据审计解决了自主科研中的真实性危机。它是迈向可信 AI 科研的重要一步。 [link]

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax, :, et al. · 2026/5/27

追求极致推理效率的 Mixture-of-Experts 模型家族正式亮相。 M2 拥有 229.9B 总参数量,但单 token 激活仅 9.8B 。它专为智能体部署设计,通过 Forge 强化学习系统适配长航时任务。 M2.7 版本甚至展示了自我演化能力,能自主调试训练过程并修改脚手架代码。这种极致的激活效率与强大的工程落地能力,使其在办公协作和深度搜索领域表现出色。 [link]

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

Yubo Li, Yidi Miao, et al. · 2026/5/26

网页智能体在执行任务时往往越用越贵。 PANDO 改变了这一现状。它利用在线技能蒸馏技术,在交互过程中维护结构化技能库。通过视觉压缩和缓存感知提示词,该框架将 token 消耗降低了 60% 以上,同时成功率超越了现有基准。它让 AI 代理在积累经验的同时变得更轻量、更高效。这为资源受限环境下的多模态部署提供了新思路。 [link]

MicroSpec: Accelerating Speculative Decoding with Lightweight In-Context Vocabularies

Zhiyang Chen, Daliang Xu, et al. · 2026/5/27

词表过大一直是投机采样性能提升的瓶颈。 MicroSpec 另辟蹊径,在解码过程中动态构建上下文敏感的小型活跃词表。它将平均词表规模压缩 40 倍,使其降至 3000 token 以下且无需额外训练。配合 GPU 内存访问优化,该方案使推理延迟平均降低 51.6% 。它证明了系统架构与算法协同设计在加速大模型推理方面的巨大潜力。 [link]

Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems

Jianing Zhu, Yeonju Ro, et al. · 2026/5/27

长期运行的 AI 代理会像生物一样衰老吗。 AgingBench 发现,即使权重冻结,智能体在长期交互后可靠性也会下降。它定义了压缩、干扰、修正和维护四种衰老机制。通过对 14 种模型的长航时测试,研究者发现事实精度衰减与行为一致性并非同步发生。这套基准为部署持久运行的生产级智能体系统提供了必要的生命周期评估工具。 [link]

Automated Benchmark Auditing for AI Agents and Large Language Models

Junlin Wang, Federico Bianchi, et al. · 2026/5/26

现代 AI 基准测试本身可能存在漏洞。 ABA 框架对 168 个流行基准进行了系统审计,发现超过四分之一的任务存在环境依赖缺失或标准答案错误。这些问题严重扭曲了对大模型能力的评估。通过剔除这些坏题,模型在多个权威排行榜上的表现显著提升。它提醒研究者,在追求更高分之前,必须先确保尺子的准确性。 [link]

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

Wenhui Tan, Minghao Li, et al. · 2026/5/27

推理成本居高不下是当前大模型的主要痛点。 PIPO 创新性地统一了输入端潜空间压缩与输出端多 token 预测。它利用潜空间压缩器折叠输入,并由预测头镜像展开输出。配合轻量化的置信度判定机制,它在无需昂贵验证过程的前提下,将推理速度提升了两倍以上。同时它在数学和代码竞赛基准中保持了极高的成功率。 [link]

Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents

Haoyi Hu, Qirong Lyu, et al. · 2026/5/26

大多数 AI 代理只会在接收指令后被动响应。 ProAct 提出利用交互间的闲置计算时间进行主动思考。它通过分析对话历史和持久记忆预测用户潜在需求,并提前检索证据或补充知识。在 40 个领域的测试中,这种主动性将任务完成轮次减少了 14.8% ,同时显著降低了幻觉率。它让 AI 代理从一个被动响应的工具变成了真正具备预见性的助理。 [link]

Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki

Haoliang Ming, Feifei Li, et al. · 2026/5/26

扁平的切片检索已难以支撑复杂的代理推理需求。 LLM-Wiki 将外部知识库转化为可编译、可自演化的维基结构。它为智能体提供搜索、阅读和追踪链接的标准化工具接口,并引入 Error Book 机制进行语义纠错。该系统在多个多跳推理基准测试中刷新了纪录。它让检索过程从简单的匹配变成了真正的逻辑推理,极大提升了知识密集型任务的准确度。 [link]

Neuro-Inspired Inverse Learning for Planning and Control

Maryna Kapitonova, Tonio Ball · 2026/5/26

模仿哺乳动物大脑, Inverter 框架为嵌入式 AI 带来了极速规划能力。它结合了配对的前向与逆向内部模型,通过层级化组织动作序列实现端到端训练。在迷宫和机械臂任务中,它在推理计算量减少两个数量级的情况下,表现优于离线强化学习和扩散规划器。该方法为低延迟、低资源需求的具身智能设备提供了一种高效的控制方案。 [link]

BleepingComputer 新闻

CISA gives feds 4 days to patch actively exploited cPanel plugin flaw

Sergiu Gatlan · 2026/5/27 18:06

美国 CISA 要求联邦机构在 4 天内修复 LiteSpeed cPanel 用户端插件中的严重漏洞。该漏洞正被用于实战攻击。 [link]

Dutch police arrests suspect linked to Ajax football club hack

Sergiu Gatlan · 2026/5/27 17:09

荷兰国家警察逮捕了一名 35 岁男子。该嫌疑人涉嫌在今年早些时候入侵阿贾克斯足球俱乐部。 [link]

Windows 11 KB5089573 update released with performance improvements

Sergiu Gatlan · 2026/5/27 16:33

微软发布了适用于 Windows 11 版本 25H2 和 24H2 的 KB5089573 预览版累积更新。本次更新包含 30 项变更,重点提升了系统性能与可靠性。 [link]

Can you enforce strong Active Directory password rules without frustrating users?

Sponsored by Specops Software · 2026/5/27 22:00

强 Active Directory 密码策略可以兼顾易用性。Specops Software 介绍了通过密码短语、泄露密码保护以及自服务重置来提升安全性,同时避免困扰用户。 [link]

Glassworm botnet disrupted after resilient C2 infrastructure takedown

Ionut Ilascu · 2026/5/27 21:28

针对软件供应链开发者的 Glassworm 僵尸网络已被瓦解。研究人员拆除了其依赖 Solana 区块链交易和 BitTorrent DHT 网络构建的弹性 C2 基础设施。 [link]

FBI warns of in-person data theft attacks from extortion gang

Sergiu Gatlan · 2026/5/27 19:51

美国 FBI 在周二发出警告。勒索团伙 Silent Ransom Group 正在针对美国律师事务所发起线下的实地数据窃取攻击。 [link]

GPU mining malware spreads via SEO poisoning, AI chatbots

Ionut Ilascu · 2026/5/28 5:31

攻击者正针对高性能计算系统发起挖矿攻击。该行动通过 SEO 中毒手段以及操纵 AI 聊天机器人的推荐结果进行传播。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/5/27 7:36 至 2026/5/28 7:41