网安 + AI 前沿日报

2026/3/18 · CyberRadar

网络安全论文

Sirens' Whisper: Inaudible Near-Ultrasonic Jailbreaks of Speech-Driven LLMs

Zijian Ling, Pingyi Hu, et al. · 2026/3/17

智能音箱可能正在被你听不到的声音控制。研究者利用硬件的非线性特性,将恶意指令隐藏在近超声波频率中。这种被称为 SWhisper 的攻击框架能在黑盒环境下绕过主流语音大模型。实验表明它在商业模型上的成功率极高,且人类受试者完全无法察觉。它揭示了语音驱动 AI 在开放声学通道中的脆弱性,提醒开发者必须重新审视语音接口的物理安全边界。 [link]

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

Zhenlin Xu, Xiaogang Zhu, et al. · 2026/3/17

别以为清空对话历史就安全了, AI 代理的长期记忆可能成为攻击者的后门。这篇论文揭示了内存控制流攻击如何利用内存检索干扰工具调用逻辑。攻击者可以诱导代理执行违背用户指令的操作,并在多个任务之间保持这种恶意行为。即便在严格的安全约束下, GPT-5 mini 等主流模型依然有超过 90% 的概率中招。这项研究为代理系统的内存隔离设计敲响了警钟。 [link]

Sovereign-OS: A Charter-Governed Operating System for Autonomous AI Agents with Verifiable Fiscal Discipline

Aojie Yuan, Haiyue Zhang, et al. · 2026/3/17

AI 代理开始管理财务,但谁来监管代理? Sovereign-OS 是一款专为自主 AI 代理设计的操作系统。它通过 YAML 格式的宪章严格约束代理的财务边界和权限范围。系统内置了类似首席财务官的组件,对每笔支出进行自动化审计,并利用 SHA-256 证明确保审计日志不可篡改。该系统成功阻断了所有测试中的违规财务操作。它为 AI 代理走向真实经济协作提供了关键的安全基石。 [link]

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

Ma\"el Jenny, J\'er\'emie Dentan, et al. · 2026/3/17

拒绝回答并不是安全防御的终点。研究者发现无需修改 prompt ,仅通过手术式修改模型内部激活值就能实现越狱。这种被称为激活手术的方法揭示了拒绝信号在神经网络各层之间的传播路径。通过在特定层替换激活值,可以有效切断模型的防御反应。这为理解大模型内部安全机制提供了全新视角,也警示了开源权重模型在推理环境下面临的深层风险。 [link]

Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use

Ziling Zhou · 2026/3/17

当 AI 代理在运行时动态获取工具权限时,权限提升风险不容忽视。该研究提出了针对工具调用的加密绑定机制。它通过扩展 X.509 证书来封装代理的技能清单,任何未经授权的工具变更都会导致证书失效。该方案在 Rust 编写的原型中表现极佳,验证开销远低于现有的零知识证明方案。它解决了欧盟 AI 法案要求的可追溯性难题,为多代理协作提供了可验证的边界。 [link]

$p^2$RAG: Privacy-Preserving RAG Service Supporting Arbitrary Top-$k$ Retrieval

Yulong Ming, Mingyue Wang, et al. · 2026/3/17

企业级 RAG 服务面临隐私泄露的窘境。 p2RAG 提出了一种支持任意数量检索结果的隐私保护方案。与传统依赖安全排序的系统不同,它采用交互式二分法定位相关文档,提升了处理大规模数据集的效率。基于 secret sharing 的架构确保了数据库和用户查询的私密性。实验显示其速度比同类尖端方案快出数百倍。它证明了在不牺牲性能的前提下,实现高强度隐私保护的知识检索是完全可行的。 [link]

vCause: Efficient and Verifiable Causality Analysis for Cloud-based Endpoint Auditing

Qiyang Song, Qihang Zhou, et al. · 2026/3/17

云端日志审计真的可信吗?如果云服务商被渗透,攻击者可能会篡改因果关系分析结果。 vCause 系统利用图累加器和可验证溯源图技术,为终端审计提供了廉价的完整性校验。安全管理员可以确信查询到的攻击路径未被篡改。系统在保持极低计算开销的同时,实现了极高的验证可靠性。这为构建零信任环境下的自动化威胁狩猎平台提供了技术支撑。 [link]

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

Xinhai Wang, Shaopeng Fu, et al. · 2026/3/17

自动化红队测试虽然高效,但其计算成本往往令人望而生畏。 PSKV 方案通过共享前缀 KV-cache ,让越狱攻击的推理速度提升了 40% 。该方法观察到不同的攻击后缀针对相同的有害指令前缀。通过在内存中维护单一的缓存副本,系统可以并行推理成千上万个候选后缀。这种即插即用的优化降低了显存消耗,同时保持了原有的攻击成功率。它让大规模安全压力测试变得触手可及。 [link]

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

Ruoxi Cheng, Yizhong Ding, et al. · 2026/3/17

网页规模的数据集可能导致多模态模型意外记住隐私。 UMID 框架仅需文本查询即可检测 CLIP 等模型是否泄露了敏感个人信息。它巧妙利用文本引导的跨模态 latent inversion 技术,提取出对齐度和变异度特征。相比传统的 shadow model 方法,该方案的审计成本极低,能在不足 1 秒内给出判断。它为监管机构评估预训练模型的合规性提供了一种高效且不侵犯隐私的工具。 [link]

When Scanners Lie: Evaluator Instability in LLM Red-Teaming

Lidor Erez, Omer Hofman, et al. · 2026/3/17

现有的 AI 安全扫描器评判标准存在漏洞。这项研究指出,不同评判器对同一越狱攻击的成功判定存在显著分歧。换掉一个组件会导致最终的安全评分剧烈波动。作者提出的可靠性感知框架通过量化评判器之间的冲突,提升了漏洞扫描的准确率。实验表明忽略这种不稳定性会让风险得分误差高达 33% 。该研究为 AI 安全评估领域的科学性竖立了新标杆,敦促研究者从依赖单一分数的盲目中清醒。 [link]

AI 论文

FLUX: Data Worth Training On

Gowtham, Sai Rupesh, et al. · 2026/3/17

现代大模型训练深受数据清洗难题困扰。 FLUX 预训练管线打破了规模与质量的权衡困局。它通过极高的 token 保留率和严苛的质量控制,显著提升了训练效率。实验显示 3 B 模型在使用 FLUX 整理的数据训练后,表现全面超越 DCLM 方案。它提取出 500 亿个高质量 token ,并让训练算力消耗降低了 34.4 % 。 [link]

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

Florin Adrian Chitan · 2026/3/17

针对自主 AI 代理执行危险操作的风险, ILION 提出了一种确定性执行闸门架构。它采用五组件级联架构,能够在亚毫秒级延迟内判定操作权限。相比 OpenAI 或 Llama 的安全接口, ILION 在处理代理执行安全任务时速度快了 2000 倍。系统无需标注数据即可运行,判决逻辑完全透明可查。这为高风险场景下的 AI 代理部署提供了可靠底层保障。 [link]

The Institutional Scaling Law: Non-Monotonic Fitness, Capability-Trust Divergence, and Symbiogenetic Scaling in Generative AI

Mark Baciak, Thomas A. Cellucci · 2026/3/17

模型规模并非越大越好。这项研究提出了机构标度律,指出机构适应性取决于能力、信任、成本和主权四个维度。当模型尺度超过特定临界点后,信任流失与成本增加会导致整体价值下降。研究主张由多个领域专用模型组成的协作系统比单一通用巨模型更具优势。这一预测为后训练时代的主权 AI 发展与专门化模型部署提供了理论支持。 [link]

AI Can Learn Scientific Taste

Jingqi Tong, Mingzhe Li, et al. · 2026/3/17

科研品味通常被视为难以量化的直觉。这项研究提出 RLCF 训练范式,通过 70 万对高低引用的论文数据,让 AI 学习判断研究点子的潜力。训练出的 Scientific Thinker 能够提出比基座模型更高产的研究方案。实验证明 AI 已经掌握了这种复杂的学术审美,并能推广到未见过的科研领域。这是迈向人类水平 AI 科学家的关键一步。 [link]

Learning to Forget: Sleep-Inspired Memory Consolidation for Resolving Proactive Interference in Large Language Models

Ying Xie · 2026/3/17

大模型处理长文本时常受到过时信息的干扰。 SleepGate 借鉴生物睡眠机制,在 KV 缓存上引入了一个学习睡眠循环。它包含冲突感知标记器、遗忘门和整合模块,能定期清理或压缩陈旧的关联。理论分析表明该方法将干扰范围从线性降低到了对数级别。在 80 万参数的小模型实验中,它将检索准确率从不足 18 % 提升到了 97 % 以上。 [link]

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

Shiva Krishna Reddy Malay, Shravan Nayak, et al. · 2026/3/17

企业级 AI 助手的落地卡在真实环境测试的缺失上。 EnterpriseOps-Gym 建立了一个包含 164 个数据库表和 512 个功能工具的容器化沙盒。它覆盖了人力资源、客户服务等 8 个核心业务垂直领域。测试发现即便是 Claude Opus 4.5 也只能达到 37.4 % 的成功率。这项工作精准定位了策略推理这一瓶颈,为提升专业工作流中的代理稳定性提供了试验台。 [link]

A Dual-Path Generative Framework for Zero-Day Fraud Detection in Banking Systems

Nasim Abdirahman Ismail, Enis Karaarslan · 2026/3/17

高频银行环境需要在欺诈检测的低延迟与监管合规的解释性之间取得平衡。这项研究提出的双路径生成框架解耦了实时异常检测与离线对抗训练。系统利用 VAE 建立合法交易流形,确保推理延迟低于 50 ms 。同时使用 WGAN-GP 模拟零日攻击场景。只有在面临高不确定性交易时才会激活 SHAP 解释机制,兼顾了实时吞吐量与审计要求。 [link]

EviAgent: Evidence-Driven Agent for Radiology Report Generation

Tuoshi Qi, Shenshen Bu, et al. · 2026/3/17

放射学报告生成的难点在于诊断过程的不可追溯。 EviAgent 放弃了黑盒式的端到端范式,将生成过程拆解为细粒度的操作单元。它集成了多维视觉专家模块和检索机制,为诊断提供显式的视觉证据和临床先验。该智能体在多个公开数据集上的表现优于专业医疗模型。它大幅提高了报告准确性,并通过透明的推理轨迹增强了临床医生的信任。 [link]

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

Ren Jian Lim, Rushi Dai · 2026/3/17

客户与建筑师之间的沟通隔阂常导致室内设计周期冗长。 AICodesign 提出了一个多模态、多智能体协作框架。它能将自然语言描述和参考图像直接转换为 Figma 格式的 3 D 设计稿。通过视觉语言模型的反射控制器进行迭代纠错,确保设计方案不退化。调查显示 77 % 的用户对该系统生成的方案表示满意。它显著降低了非专业人士参与专业设计的门槛。 [link]

Early Rug Pull Warning for BSC Meme Tokens via Multi-Granularity Wash-Trading Pattern Profiling

Dingding Cao, Bianbian Jiao, et al. · 2026/3/17

去中心化金融中的模因币频繁发生归零骗局。这项研究为 BSC 链上的代币提供了一套端到端的预警框架。它构建了 12 个代币级别的行为特征,统一了交易、地址和资金流信号。系统能够精准识别自交易、匹配交易和循环交易等洗售模式。实验显示随机森林模型在识别风险币时 PR-AUC 达到 0.9185 。该方案为加密货币市场的自动化风控提供了可行路径。 [link]

BleepingComputer 新闻

Microsoft: Enabling Teams Meeting add-in breaks Outlook Classic

Sergiu Gatlan · 2026/3/17 18:37

微软正在修复一个已知问题。启用 Microsoft Teams Meeting 加载项后,经典版 Outlook 邮件客户端将无法使用。 [link]

New Windows 11 hotpatch fixes Bluetooth device visibility issue

Sergiu Gatlan · 2026/3/17 19:07

微软发布紧急更新。此次更新修复了启用热补丁功能的 Windows 11 企业版设备中 Bluetooth 设备可见性的问题。 [link]

LeakNet ransomware uses ClickFix, Deno runtime in stealthy attacks

Bill Toulas · 2026/3/17 20:09

LeakNet 勒索软件团伙利用 ClickFix 技术获取企业环境的初始访问权限。该组织部署了基于开源 Deno 运行时的恶意软件加载器,支持 JavaScript 和 TypeScript。 [link]

Microsoft shares fix for Windows C: drive access issues on Samsung PCs

Sergiu Gatlan · 2026/3/17 20:03

微软发布修复指南。该指南针对运行 Windows 11 25H2 和 24H2 版本的某些三星笔记本,解决了 C 盘访问异常以及应用运行失败的问题。 [link]

Top 5 Things CISOs Need to Do Today to Secure AI Agents

Sponsored by Token Security · 2026/3/17 22:02

AI 智能体是具备数据和系统访问权限的自主代理。Token Security 阐述了基于身份的访问控制在防止滥用及数据泄露方面的重要性。 [link]

New font-rendering trick hides malicious commands from AI tools

Bill Toulas · 2026/3/17 21:59

一种新型字体渲染攻击通过将恶意指令隐藏在无害的 HTML 代码中,导致 AI 助手无法识别网页上的恶意命令。 [link]

Microsoft stops force-installing the Microsoft 365 Copilot app

Sergiu Gatlan · 2026/3/17 21:54

微软停止在欧洲经济区以外的 Windows 设备上强制安装 Microsoft 365 Copilot 应用。此前安装过 Microsoft 365 桌面版应用的设备会受到自动安装影响。 [link]

Europe sanctions Chinese and Iranian firms for cyberattacks

Bill Toulas · 2026/3/18 2:41

欧盟理事会对三个实体和两名个人实施制裁。这些对象参与了针对该地区关键基础设施的网络攻击。 [link]

GlassWorm malware hits 400+ code repos on GitHub, npm, VSCode, OpenVSX

Bill Toulas · 2026/3/18 5:42

GlassWorm 供应链攻击再次出现。此次协同攻击的目标涵盖 GitHub、npm 以及 VSCode 和 OpenVSX 扩展商店中的数百个软件包与仓库。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/3/17 6:54 至 2026/3/18 6:57