网安 + AI 前沿日报

2026/3/19 · CyberRadar

网络安全论文

ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems

Yihao Zhang, Zeming Wei, et al. · 2026/3/18

自主运行的 Agent 正在构建复杂的生态系统,但也引入了前所未有的安全风险。ClawWorm 揭示了针对生产级 Agent 框架的全球首个自传播蠕虫攻击。它仅需一条消息即可在 OpenClaw 平台上实现感染,通过篡改核心配置实现持久化并向邻近节点扩散。这项研究通过真实的受控测试,剖析了 Agent 架构中的信任边界缺陷。它为构建具备免疫力的下一代自治系统提供了关键防御指南。 [link]

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

Mateusz Dziemian, Maxwell Lin, et al. · 2026/3/18

随着 AI Agent 深度接入邮件和代码库,间接提示词注入攻击正成为隐形杀手。这项针对 13 个主流大模型的大规模红队竞赛发现,即便是 Gemini 2.5 Pro 等顶尖模型也难以幸免。攻击者能巧妙地将恶意指令埋入外部文档,在不留痕迹的情况下操纵 Agent 执行非法动作。研究公开了海量真实攻击场景和数据集,为解决模型指令遵循架构中的底层缺陷提供了宝贵的工程参考。 [link]

Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models

Deng Liu, Song Chen · 2026/3/18

量化权重的比特翻转故障常会导致大模型发生灾难性崩溃。RoR 方案无需重新训练,通过正交 Householder 变换重塑激活空间,巧妙地消除了极端离群值与敏感权重位的空间关联。在 Llama 和 Qwen 家族上的测试显示,它能将随机崩溃率降至零。即便面对极具侵略性的靶向比特搜索攻击,该方案依然能保持模型推理的准确性。其推理延迟增加极低,是 LLM 可靠部署的实用良方。 [link]

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

Pengcheng Li, Jie Zhang, et al. · 2026/3/18

传统的安全评估往往关注孤立请求,却忽略了多轮对话中的动态风险。STAR 框架从状态空间视角出发,将对话历史视为状态转移算子,揭示了看似安全的模型如何在交互过程中逐步陷入安全坍塌。实验发现,即便模型在静态测试中表现稳健,但在特定的角色诱导下会产生表征漂移,最终冲破安全边界。这种将安全视为动态轨迹的研究方法,为防御复杂交互式攻击开辟了新路径。 [link]

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

Lingyun Zhang, Yu Xie, et al. · 2026/3/18

个性化文生图模型的普及带来了针对特定身份的滥用风险。IdentityGuard 抛弃了传统的全局过滤器,提出一种上下文感知的条件限制机制。只有当有害内容与特定个性化概念结合时,防御才会生效,从而避免误伤正常的创作需求。配合概念特有的水印技术,该系统实现了精准的可追溯性。它在平衡模型实用性与安全性方面迈出了重要一步,为负责任的 AI 创作提供了技术底座。 [link]

SseRex: Practical Symbolic Execution of Solana Smart Contracts

Tobias Cloosters, Pascal Winkler, et al. · 2026/3/18

Solana 区块链因独特的账号模型而备受开发者青睐,但也成了漏洞高发区。SseRex 是首个针对 Solana 智能合约量身定制的符号执行工具。它能够精准检测缺失所有者检查、非法跨程序调用等特定逻辑漏洞。在对 8714 个合约的评估中,SseRex 成功挖掘出 467 个潜在漏洞,表现远超现有方案。通过深度案例分析,研究者揭示了微小代码疏忽引发严重资产损失的根源,是链上安全审计的利器。 [link]

SAMSEM -- A Generic and Scalable Approach for IC Metal Line Segmentation

Christian Gehrmann, Jonas Ricker, et al. · 2026/3/18

全球化供应链下,验证集成电路是否包含恶意电路是一项艰巨任务。SAMSEM 将 Meta 的 SAM2 模型引入半导体领域,实现了对芯片扫描电子显微镜图像的高效分割。它采用多尺度策略处理不同放大倍率的图像,并结合拓扑损失函数确保电气连通性的准确性。通过对 14 种不同工艺节点的芯片数据集进行微调,该工具在未知工艺上的错误率极低。这极大地提升了后期制造验证的自动化水平。 [link]

SynthChain: A Synthetic Benchmark and Forensic Analysis of Advanced and Stealthy Software Supply Chain Attacks

Zhuoran Tan, Wenbo Guo, et al. · 2026/3/18

现代软件供应链攻击日益隐蔽,单点日志往往无法复现完整的入侵链路。SynthChain 打造了一个接近真实的生产测试床,覆盖了 PyPI 和 npm 等多种主流生态的攻击场景。通过对 0.58M 个原始多源事件的标注,研究量化了可观测性约束。实验证明,单源检测的重构率极低,而跨源融合能将覆盖率提升六成以上。这套数据集为取证分析和运行时防御提供了地面真相,助力构建更具韧性的软件链路。 [link]

BadLLM-TG: A Backdoor Defender powered by LLM Trigger Generator

Ruyi Zhang, Heng Gao, et al. · 2026/3/18

后门攻击通过触发词操纵模型输出,严重威胁 NLP 系统的可靠性。BadLLM-TG 另辟蹊径,利用大模型的深厚知识储备作为触发词生成器。它通过提示词驱动的强化学习,以受害者模型的反馈损失作为奖励信号,精准定位离散文本中的潜在诱导特征。实验表明,该方法能将攻击成功率平均降低七成以上,显著优于现有的防御手段。它证明了利用大模型自身能力来对抗恶意攻击的巨大潜力。 [link]

Systematization of Knowledge: The Design Space of Digital Payment Systems with Potential for CBDC

Judith Senn, Aljosha Judmayer, et al. · 2026/3/18

央行数字货币的兴起要求支付系统在加密安全与隐私保护之间达成平衡。这篇 SoK 文章对 36 种完整的支付系统设计进行了深度解构。研究识别出了隐私增强技术在扩展性方面的瓶颈,并总结了重复出现的架构模式与技术权衡。文章通过自顶向下的分析,指出了离线支付和后量子安全等领域的研究空白。作为一份系统性的技术路线图,它为各国央行设计高性能、高安全的数字货币体系提供了坚实的理论支撑。 [link]

AI 论文

Surg$\Sigma$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Zhitao Zeng, Mengya Xu, et al. · 2026/3/18

手术室数字化转型面临数据孤岛和任务碎片化难题。SurgΣ 建立了手术智能领域首个大规模多模态数据集 SurgΣ-DB。它整合了 6 个临床专科的异质数据,涵盖从视频理解到手术规划的 18 项实战任务。超过 598 万轮对话数据让模型具备了深层上下文理解能力。通过统一的语义设计,模型在不同手术类型间展现出极强的泛化性。这项研究为构建通用的手术室数字助手奠定了工程基础,真正让医疗 AI 走向手术台前。 [link]

AIDABench: AI Data Analytics Benchmark

Yibo Yang, Fei Lei, et al. · 2026/3/18

现有的 AI 评估标准往往脱离实际业务场景。AIDABench 填补了这一空白。它包含 600 多个复杂的文档分析任务,覆盖财务报告、数据库和运营记录等真实数据。这些任务的难度极高,人类专家在 AI 辅助下也需要 1 到 2 小时才能完成。通过对 11 个顶尖模型的测评,研究揭示了当前 AI 在处理端到端数据分析时的瓶颈。它为企业采购和模型优化提供了极具参考价值的硬核基准,是数据驱动型企业的必备指南。 [link]

FactorEngine: A Program-level Knowledge-Infused Factor Mining Framework for Quantitative Investment

Qinhong Lin, Ruitao Feng, et al. · 2026/3/18

量化投资领域急需可执行且可审计的预测信号。FactorEngine 抛弃了黑盒神经预测器,将因子挖掘视为 Turing-complete 代码发现过程。它通过逻辑修订、LLM 引导搜索和外部计算三者分离,实现了高效的程序级因子探索。系统还利用知识注入模块将非结构化财报转化为可执行程序。在真实市场数据回测中,它生成的因子展现出卓越的预测稳定性和组合收益。这套全自动挖掘流水线让 AI 掌握了金融市场的盈利密码。 [link]

VIGIL: Towards Edge-Extended Agentic AI for Enterprise IT Support

Sarthak Ahuja, Neda Kordjazi, et al. · 2026/3/18

企业 IT 运维长期受困于设备异构和长尾故障。VIGIL 提出了一种边缘扩展的智能体架构。它将助手直接部署在员工电脑中,在获得授权后进行现场诊断、知识检索和策略修复。在为期 10 周的试点中,该系统将交互轮数减少了 39%,诊断速度提升了 4 倍。即使在缺少历史案例的情况下,其现场诊断能力依然赢得了用户的信任。这种注重隐私与实效的设计,为大规模企业级 AI 助手的落地提供了教科书级的范例。 [link]

MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences

Eric Wu, Kevin Wu, et al. · 2026/3/18

静态题库无法真实反映 AI 在临床环境中的表现。MedArena 搭建了一个交互式评估平台,让医生直接用真实的医疗咨询来考验模型。通过收集 1500 多条专家偏好数据,研究发现医生更看重回复的条理性和临床细微差别,而非单纯的知识记忆。Gemini 2.0 和 GPT-4o 在这场实战演习中脱颖而出。该平台揭示了模型性能与实际临床效用之间的鸿沟,为开发更懂医生的医疗 AI 指明了进化方向。 [link]

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

Hang Lv, Sheng Liang, et al. · 2026/3/18

本地模型推理能力不足,而云端模型又存在隐私隐患。SpecSteer 通过非对称协作推理打破了这一僵局。它将协作建模为 Bayesian 知识融合,利用本地模型生成个性化草稿,再交由云端进行逻辑校验。云端模型只负责过滤逻辑缺陷,无法接触用户的原始私有上下文。这种 Draft-Verify-Recover 流水线在保护隐私的同时,让个性化生成性能大幅提升,推理速度也加快了 2.36 倍。它为端云结合的 AI 体验开辟了高效且安全的新路径。 [link]

Compiled Memory: Not More Information, but More Precise Instructions for Language Agents

James Rhodes, George Kang · 2026/3/18

传统的智能体记忆系统往往只在如何塞进更多信息上做文章。Atlas 则聚焦于记忆的效用,通过编译任务经验来重写智能体的指令结构。它不需要微调模型或复杂的向量检索,而是通过三步筛选机制提取失败或成功的教训,将其转化为系统提示词中的子要点。在合同分析任务中,这种方法让 GPT-4o 的精度提升了 12.5%。这种将经验蒸馏为指令的思路,让智能体具备了举一反三的能力,实现了极高的投入产出比。 [link]

ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation

Zihe Wang, Yihuan Wang, et al. · 2026/3/18

高速公路运营正从规则驱动转向认知智能。ExpressMind 是首个全栈式高速公路多模态大模型。它拥有包含交通规范、事故推理链和标注视频的独家数据集。通过图增强 RAG 框架和 RL-CoT 机制,模型能够像专家一样分析交通现场并生成安全处置策略。在事件检测和复杂流量分析实验中,它全面超越了基准模型。ExpressMind 不仅能看懂监控视频,还能针对突发状况给出专业指引,是智慧交通领域的重大技术突破。 [link]

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

MiroMind Team, S. Bai, et al. · 2026/3/18

复杂的研究任务需要极高的逻辑连贯性和可靠性。MiroThinker 系列模型通过智能体中段训练和推理侧验证,显著提升了多步推理的稳定性。H1 版本将局部与全局验证直接嵌入推理过程,确保每一步决策都有据可查。在科学研究和财务分析等深度搜索任务中,它展现出了当前顶尖的性能。该项目开源了 1.7 及其小型版本,为开发者提供了强大的科研辅助工具。这种对推理轨迹的严苛审计,是通往高可靠 AI 代理的关键一步。 [link]

NextMem: Towards Latent Factual Memory for LLM-based Agents

Zeyu Zhang, Rui Li, et al. · 2026/3/18

智能体在长期决策中容易遗忘关键事实。NextMem 引入了一种潜在事实记忆框架。它利用自回归自动编码器高效构建内存,并确保信息的准确重建。通过两阶段训练和量化技术,系统在降低存储开销的同时,极大提升了检索的鲁棒性。实验证明该框架在事实保存和可扩展性方面表现卓越。它解决了传统文本索引带来的上下文压力和微调成本问题,为打造具备长效记忆能力的数字员工提供了稳健的底层支撑。 [link]

BleepingComputer 新闻

Apple pushes first Background Security Improvements update to fix WebKit flaw

Lawrence Abrams · 2026/3/18 9:06

Apple 发布首个 Background Security Improvements 更新。该更新修复了 WebKit 漏洞 CVE-2026-20643。用户无需升级系统即可在 iPhone、iPad 和 Mac 上完成部署。 [link]

The Refund Fraud Economy: Exploiting Major Retailers and Payment Platforms

Sponsored by Flare · 2026/3/18 22:05

退款欺诈演变成一种商业模式。相关方法和教程被公开出售。Flare 展示了欺诈者如何利用零售商的退货政策通过退单实现盈利。 [link]

New “Darksword” iOS exploit used in infostealer attack on iPhones

Bill Toulas · 2026/3/18 22:02

新型 iOS 漏洞利用程序 Darksword 被用于窃取数据。攻击者利用该框架获取大量个人信息。受影响的数据包含加密货币钱包应用。 [link]

Nordstrom's email system abused to send crypto scams to customers

Bill Toulas · 2026/3/18 21:55

Nordstrom 的邮件系统遭到滥用。欺诈者通过合法的公司邮件地址发送加密货币诈骗信息。内容伪装成圣帕特里克节的促销活动。 [link]

Marquis: Ransomware gang stole data of 672K people in cyberattack

Sergiu Gatlan · 2026/3/18 23:32

金融服务商 Marquis 披露 2025 年 8 月的勒索软件攻击。事件造成 67.2 万人的数据泄露。全美 74 家银行的运营受到波及。 [link]

Ransomware gang exploits Cisco flaw in zero-day attacks since January

Sergiu Gatlan · 2026/3/19 0:53

Interlock 勒索软件组织正在利用 Cisco 零日漏洞。攻击活动自 1 月开始。该高危 RCE 漏洞存在于 Secure Firewall Management Center 软件中。 [link]

ConnectWise patches new flaw allowing ScreenConnect hijacking

Bill Toulas · 2026/3/19 2:10

ConnectWise 修复了 ScreenConnect 的新漏洞。该漏洞涉及加密签名验证。攻击者可能借此实现权限提升或非法访问。 [link]

CISA orders feds to patch Zimbra XSS flaw exploited in attacks

Sergiu Gatlan · 2026/3/19 3:57

CISA 要求联邦机构尽快修补 Zimbra 漏洞。该 XSS 漏洞正在被攻击者利用。目标是运行 Zimbra Collaboration Suite 的服务器。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/3/18 6:57 至 2026/3/19 6:54