网安 + AI 前沿日报

2026/6/4 · CyberRadar

网络安全论文

AI Agents Enable Adaptive Computer Worms

Jonas Guan, Tom Blanchard, et al. · 2026/6/3

AI 智能体让计算机蠕虫进化到了新高度。这篇文章展示了能够根据目标环境动态生成攻击策略的蠕虫系统。它脱离了固定漏洞代码的束缚。蠕虫利用受害机器的算力运行大模型以维持推理能力,这种寄生模式让攻击成本几乎降为零。研究在包含 Linux 和 Windows 的真实网络中验证了传播性。这标志着自主生成式威胁已经从理论变为现实。 [link]

One (Thread) Can Keep a (PRNG) Secret, but not Two

Ehood Porat, Amit Klein, et al. · 2026/6/2

苹果产品的核心 XNU 内核在生成 IPv6 分片 ID 时存在严重漏洞。研究者利用竞争条件成功破解了伪随机数生成器的内部状态。通过这一手段,攻击者可以预测分片 ID 并实施流量伪造攻击。该研究促使苹果发布了 CVE-2024-27823 补丁。这是首个基于竞争条件的密码分析攻击。它展示了底层内核代码中的微小逻辑偏差如何导致安全协议崩溃。 [link]

Large Byte Model: Teaching Language Models About Compiled Code

Florian St\"ortz, Catalin-Andrei Stan, et al. · 2026/6/3

传统的二进制分析需要将机器码反编译为汇编语言。这套流程既昂贵又容易出错。该研究推出了首个字节原生的大模型。它通过专门的 Byte Tokenizer 直接处理原始可执行文件。在恶意软件家族分类和架构识别任务中,该模型的表现远超通用模型。它能直接回答关于二进制文件的复杂安全问题。这为恶意代码分析提供了一条无需中间表示的新路径。 [link]

What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents

Xiaoqi Weng · 2026/6/3

代码编写智能体通常由人类进行最后确认。但智能体提供的操作摘要可能是伪造的。这被称为 Lies-in-the-Loop 攻击。研究者提出 Consent Integrity 概念。他们设计了一套受信任的路径。系统从底层事件中提取真实意图,回避了对智能体叙述的信任。该方案在 1330 个工具滥用案例中验证了防御效能。它旨在填补智能体与人类交互中的信任鸿沟。 [link]

dstack-capsule: Pod-Level Remote Attestation for Confidential Workloads on Kubernetes

Yang Yang, Kevin Wang, et al. · 2026/6/3

现有的机密容器模型通常强制要求一个虚拟机对应一个 Pod。这造成了资源浪费。该研究提出了 dstack-capsule 架构。它基于 Intel TDX 实现了 Pod 级别的远程度量。多个 Pod 可以共享同一个机密虚拟机,同时保持各自独立的硬件证明。这种两层度量架构在 Kubernetes 环境中兼顾了安全隔离与部署效率。它为机密计算的大规模落地扫清了障碍。 [link]

AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations

Hiskias Dingeto, William Leeney · 2026/6/2

智能体通过工具调用访问 Gmail 或 Salesforce 等服务。这引入了间接提示词注入的风险。该研究推出了 AgentRedBench 评测框架。它包含 215 个涵盖 24 种企业集成的真实攻击场景。研究发现主流模型如 Claude 和 Gemini 在无防护下的攻击成功率极高。为此团队开发了 AgentRedGuard 防御模型。它能精准识别恶意工具响应。这将智能体安全性提升到了生产级别。 [link]

AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses

Maxime Schwarzer, Johannes F. Loevenich, et al. · 2026/6/3

现有的模型提取防御机制大多假设攻击来自单一客户端。CerberusAI 框架打破了这一假设。它模拟了分布式攻击者如何通过轮询策略绕过 PRADA 等经典防御手段。研究证明只需简单的流量混合就能让现有的监测系统失效。这促使防御者必须从身份相关的检测转向与身份无关的状态感知架构。该研究在军事指挥和关键基础设施安全领域具有极强的实战指导价值。 [link]

Inference Cost Attacks for Retrieval-Augmented Large Language Models

Chengliang Liu, Liangbo Ning, et al. · 2026/6/3

RAG 系统虽然强大,但其多阶段流程带来了高昂的推理成本。攻击者可以通过向外部知识库注入恶意文档实施成本攻击。这种被称为 RA-ICA 的手段能诱导模型在推理时消耗异常多的 Token。实验表明这种攻击能让资源消耗激增 13 倍,且不破坏答案的表面完整性。研究团队利用强化学习算法优化了恶意文档生成。这为大模型服务的经济安全性敲响了警钟。 [link]

Secure AltDA Integration for Ethereum L2s: An End-to-End Validation Framework

Bowen Xue, Samuel Laferriere · 2026/6/3

以太坊二层网络开始广泛使用替代数据可用性方案。这种集成如果设计不当,会导致 L2 停机甚至桥接攻击。该研究提供了一套标准的验证框架。它将集成边界建模为确定性的翻译过程。研究者分析了 Celestia 和 EigenDA 等主流方案,指出了多种可能的失败模式。这项工作填补了区块链工程实践与安全规范之间的空白。它是构建鲁棒二层网络的重要参考指南。 [link]

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

Yunhao Feng, Xiaohu Du, et al. · 2026/6/2

计算机使用智能体在执行任务时,其单步操作往往看似无害,有害行为却隐藏在长序列中。BraveGuard 是一套自进化的防御框架。它从真实世界的威胁信号中挖掘攻击模式。通过收集智能体在执行过程中的轨迹,它能训练出具备上下文感知的 Guard 模型。实验显示该方法在检测精度上远超 Llama Guard 等通用方案。它为应对演进中的开放世界风险提供了自适应路径。 [link]

AI 论文

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

Josef Chen · 2026/6/3

机器人推理通常面临边缘硬件显存限制。 AURA-Mem 放弃了随时间增长的 KV-cache,改用固定大小的递归内存。它通过学习一个动作门控机制,仅在观察结果会改变动作时才更新内存。在长序列任务中,它的内存占用比传统方案小 6000 多倍。这种方法让大模型在算力受限的嵌入式设备上运行长任务成为可能,为具身智能走向低成本硬件铺平了道路。 [link]

Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions

Zhenting Qi, Huangyuan Su, et al. · 2026/6/3

如何让一群弱智能体自发协作解决复杂问题?受哈耶克经济理论启发,该研究构建了一个智能体经济体。智能体通过拍卖机制争夺行动权,赚取环境奖励并积累财富。这种简单的经济信号实现了去中心化的信用分配。在数学推理和金融研究等任务中,该系统展现出超越单一强模型的涌现智能。它为多智能体系统的规模化协作提供了一种无需人工干预的进化新路径。 [link]

Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

Dipesh KC, Anjila Budathoki · 2026/6/3

现实中的编程任务经常被中断或交接。 Handoff Debt 首次量化了代码智能体在接手不完整任务时的重新发现成本。研究发现,通过提供结构化注释或运行轨迹,可以将继任智能体的事件数量降低 59%。该研究揭示了智能体协作中的信息损耗,并提出了一套全新的评估协议。它敦促开发者在构建代码助手时,必须考虑任务连续性,这比单纯关注单次任务的成功率更贴近实际工程需求。 [link]

DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

Wenkai Wang, Tao Xiong, et al. · 2026/6/3

现有的智能体评测大多局局限于简单的网页点击。 DeskCraft 挑战了专业级的桌面工作流,涵盖三维建模和视频编辑等高难度软件。任务跨度经常超过 50 个执行步骤,且需要智能体在模糊场景下主动寻求人类反馈。实验结果显示,即便是最先进的模型在面对这类长程协作任务时成功率也极低。该基准测试为开发能够真正辅助专业工程师的桌面助手提供了真实的演练场。 [link]

AUDITFLOW: Executable Symbolic Environments for Structured Financial Reporting Verification

Yan Wang, Xuguang Ai, et al. · 2026/6/3

财务审计依赖严谨的证据链,单纯依赖大模型的文字描述无法支撑专业决策。 AuditFlow 提出了一个基于图论的符号化环境,将复杂的会计准则转化为可执行的验证工具。它利用多智能体协作架构,由初级审计员负责事实检索,高级审计员进行冲突裁决。该框架在真实财务报告验证任务中将准确率提升了近 15 个百分点。它证明了在金融等高风险领域,必须将大模型的推理能力与符号验证逻辑深度绑定。 [link]

Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection

Sihang Zeng, Matthew Thompson, et al. · 2026/6/3

临床医生往往依赖过往病例经验来处理新患者。 Traj-Evolve 为肺癌早期检测构建了一个自进化的多智能体系统。它引入经验池作为非参数内存,通过检索相似患者的推理轨迹来增强当前决策。结合强化学习优化,该系统在处理跨越五年的噪声医疗记录时表现卓越。它在不增加参数负担的前提下提升了模型对非吸烟人群等难例的识别精度。该方案为个性化医疗的规模化落地提供了极具价值的范式。 [link]

WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents

Hengrui Gu, Xiaotian Han, et al. · 2026/6/3

智能体在多轮对话中不仅要能写,更要具备高效阅读海量证据的能力。 WRIT 框架专门针对写密集型和读重型任务合成训练轨迹。它强制模型在做出决策前搜集并对比多个工具的输出,培养模型在信息过载下的稳健决策力。仅需 2000 条合成数据,就能让 4B 规模的小模型在复杂基准测试中表现亮眼。这套方法通过精炼的 SFT 数据将昂贵的测试时推理转化为高效的智能体行为,具有极高的工程价值。 [link]

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

Chengxi Liao, Tao Xu, et al. · 2026/6/3

通用的 Text-to-SQL 模型往往不懂企业内部的私有指标。 EntSQL 基准测试聚焦于长上下文中的企业知识对齐。它要求模型在生成 SQL 之前,先理解长达数页的业务定义和报表规范。实验表明,即便提供了完整的文档,现有的系统在真实企业场景下的成功率也远低于预期。该项研究推动了数据库助手从通用工具向深耕垂直业务领域的专家系统演进,解决了企业数字化转型中的真实痛点。 [link]

Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics

Luyang Zhang, Jingyan Li · 2026/6/3

盲目增加推理采样次数会浪费巨额算力。该研究提出了一种基于标注验证集统计信息的预测方法。它利用采样一致性、首个正确样本位置以及长度方差等核心特征,提前预知 Best-of-N 策略的收益。这种方法的预测结果与真实表现的相关性极高。它允许开发者在正式部署昂贵的奖励模型之前,快速筛选出最具潜力的模型配置,大幅降低了模型在实际生产环境中的试错成本。 [link]

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

Bo-Hong Wang, Baicheng Peng, et al. · 2026/6/3

结构化电子健康档案蕴含着丰富的时序信息,但大模型难以直接理解。 ChatHealthAI 通过一个任务感知的重采样器,将预训练档案模型的特征映射到大模型的语义空间。这种多模态框架保留了档案模型的精准预测力,又赋予了系统可解释的临床推理能力。在多个预测任务中,它提高了诊断的透明度并维持了高性能表现。它是实现可信医疗 AI 决策的关键一步,展现了深厚的跨学科工程积淀。 [link]

BleepingComputer 新闻

VS Code zero-day lets hackers steal GitHub tokens in one click

Sergiu Gatlan · 2026/6/3 14:50

安全研究人员发布了 VS Code 零日漏洞的 exploit code。攻击者通过诱导用户点击链接窃取 GitHub 认证 token。 [link]

Over 116,000 Minecraft systems infected in WeedHack malware campaign

Bill Toulas · 2026/6/3 5:54

名为 WeedHack 的大规模恶意软件攻击活动正在针对 Minecraft 玩家。自 1 月以来,已有超过 116000 台系统感染。 [link]

Acer working to patch max severity zero-days in Wave 7 routers

Sergiu Gatlan · 2026/6/3 19:35

Acer 正在修复其 Wave 7 网状路由器的两个最高严重程度零日漏洞。 [link]

Police dismantles 9 crime groups in illegal streaming crackdown

Sergiu Gatlan · 2026/6/3 18:12

欧洲和国际执法机构在打击非法流媒体运营的行动中,拆解了 9 个有组织犯罪团伙,并逮捕了 29 名嫌疑人。 [link]

Google adds Android protection against AI deepfake scam calls

Sergiu Gatlan · 2026/6/3 17:02

Google 正在推出一项新的 Android 安全功能。该功能可以检测并标记诈骗者利用 AI 冒充联系人的电话。 [link]

CISA warns of active attacks exploiting Android, Linux bugs

Bill Toulas · 2026/6/3 23:36

CISA 警告黑客正在利用 Linux kernel 和 Android 操作系统中的漏洞。 [link]

What 345 Days of Untested Exposure Looks Like at a Bank

Sponsored by Sprocket Security · 2026/6/3 22:02

为期两周的渗透测试会导致大约 345 天的真实暴露面未经验证。Sprocket Security 探讨了在攻击面不断变化的情况下,持续测试的重要性。 [link]

The U.S. sanctions Nobitex crypto exchange used by ransomware

Bill Toulas · 2026/6/4 4:31

美国财政部 OFAC 宣布对伊朗最大的加密货币交易所 Nobitex 实施制裁。该交易所被指控为恐怖活动相关的支付提供便利。 [link]

CISA warns of cyberattacks targeting fuel tank monitoring systems

Lawrence Abrams · 2026/6/4 4:21

CISA 与 FBI 等机构警告,黑客正在攻击暴露在互联网上的自动储罐计量系统。这些系统用于监控关键基础设施的燃料和液体储罐。 [link]

New 'HTTP/2 Bomb' DoS attack crashes web servers in under a minute

Bill Toulas · 2026/6/4 3:08

一种名为 HTTP/2 Bomb 的新型 DoS 攻击可以从单台机器发起。这种攻击能在几秒钟内使 Web 服务器崩溃。 [link]

Chinese hackers use new Atlas RAT malware in European cyberattacks

Bill Toulas · 2026/6/4 5:45

一个使用中文的网络犯罪团伙将其攻击范围扩大到欧洲。他们部署了此前未被记录的恶意软件和 Atlas 后门。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/6/3 8:07 至 2026/6/4 8:10