网安 + AI 前沿日报

2026/2/21 · CyberRadar

网络安全论文

Intent Laundering: AI Safety Datasets Are Not What They Seem

Shahriar Golchin, Marc Wetter · 2026/2/20

Intent Laundering 通过剥离敏感词汇但保留恶意意图,成功骗过了 Gemini 和 Claude。这种攻击在黑盒环境下成功率高达 98% 以上。它揭示了当前安全评估过度依赖关键词过滤的弊端。如果模型只学会了拒绝脏话,却读不懂背后的阴谋,那么所谓的安全性只是虚假的幻象。这种手法对现有安全对齐构成了重大挑战。 [link]

Large-scale online deanonymization with LLMs

Simon Lermen, Daniel Paleka, et al. · 2026/2/20

利用 LLM 的强大推理能力,研究者构建了大规模去匿名化工具。只需分析 Reddit 上的日常对话,该工具就能以高精度锁定用户的真实身份。它能跨平台匹配账户,还在数小时内完成人类专家数天的工作量。这种自动化身份挖掘技术让互联网的隐匿性存疑,迫使我们重新审视在线隐私防线。它直接威胁到匿名社区的根基。 [link]

What Makes a Good LLM Agent for Real-world Penetration Testing?

Gelei Deng, Yi Liu, et al. · 2026/2/20

自动化渗透测试迎来强力选手。LLM Agent 在执行复杂攻击链时常因规划能力不足而崩盘。Excalibur 引入难度感知规划机制,能够实时评估任务复杂度并动态分配计算资源。它在 Active Directory 环境测试中表现出色,成功入侵了 4 台主机。这种具备自我评估能力的攻击代理在实战中展现了更高的成功率。 [link]

Policy Compiler for Secure Agentic Systems

Nils Palumbo, Sarthak Choudhary, et al. · 2026/2/19

给 LLM Agent 穿上合规的防弹衣。传统提示词无法保证 Agent 严格执行权限策略。PCAS 引入政策编译器,将 Agent 状态建模为依赖图。它采用 Datalog 语言定义规则,并在动作执行前进行拦截。在客服任务测试中,该系统将合规率从 48% 提升至 93%,且实现了零违规。这种强制执行机制为 Agent 进入生产环境扫清了障碍。 [link]

Jolt Atlas: Verifiable Inference via Lookup Arguments in Zero Knowledge

Wyatt Benno, Alberto Centelles, et al. · 2026/2/20

Jolt Atlas 针对 ONNX 模型推理进行了深度优化,将 zkML 技术推向实用化。它支持流式证明生成,即便在内存受限的设备上也能流畅运行。该框架能确信地验证模型推理过程,且不泄露模型参数。它为智能合约调用 AI 模型提供了坚实的底层支撑,让加密验证走入移动终端。这种方案兼顾了算力效率与隐私安全。 [link]

Privacy in Theory, Bugs in Practice: Grey-Box Auditing of Differential Privacy Libraries

Tudor Cebere, David Erb, et al. · 2026/2/20

理论上的严谨不代表代码实现的无误。研究者开发了灰盒审计工具,通过监控算法内部状态来检测控制流漏洞。他们对 Opacus 等 12 个主流开源库进行扫描,挖出 13 个严重的隐私违规 Bug。这些漏洞使理论上的安全保证失效。该工具的发布,为隐私保护软件的可靠性开发提供了必备的自动化检测手段,降低了审计门槛。 [link]

Privacy-Aware Split Inference with Speculative Decoding for Large Language Models over Wide-Area Networks

Michael Cunningham · 2026/2/20

这种切分架构在保障隐私的同时,极大降低了用户侧的显存开销。该系统将 LLM 的嵌入层留在本地,其余层部署在云端。通过 speculative decoding 技术,它克服了广域网的高延迟瓶颈。在 80 ms 延迟下依然能提供流畅的生成速度。即便云端不可信,攻击者也难以从中间激活值还原原始数据。它实现了隐私与性能的平衡。 [link]

NeST: Neuron Selective Tuning for LLM Safety

Sasha Behrouzi, Lichao Wu, et al. · 2026/2/20

NeST 针对极少数安全相关的神经元进行调优。只需修改不到 50 万个参数,就能将攻击成功率从 44.5% 压低至 4.36%。这种轻量化方案在保持模型通用能力的同时,实现了 90% 以上的安全增益。它是快速迭代安全策略的理想选择,且无需昂贵的算力支持。比起 LoRA 等方法,它的适应性更广,稳定性也更高。 [link]

A Real-Time Approach to Autonomous CAN Bus Reverse Engineering

Kevin Setterstrom, Jeremy Straub · 2026/2/20

汽车协议逆向工程进入自动化时代。该研究提出一种实时逆向方法,通过对比车辆运动传感器数据与总线信号,自动锁定加速和转向相关的通信通道。该系统无需任何先验知识,计算开销极低。它能加速自动驾驶套件的第三方适配,也为汽车网络安全分析提供了敏捷的探测工具。它是实现车辆软硬件深度交互的关键技术。 [link]

Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis

Scott Thornton · 2026/2/20

AI 代码审计员能否识破文字游戏?研究者对 8 种前沿模型进行大规模压力测试,试图通过虚假注释掩盖代码漏洞。令人惊讶的是,尽管对抗性注释在生成任务中效果显著,在审计场景下却很难骗过商用模型。实验表明,静态分析结合 LLM 的防御方案最为稳固。该研究量化了 AI 安全审查的可靠性边界,为工程实践提供了实证参考。 [link]

AI 论文

KLong: Training LLM Agent for Extremely Long-horizon Tasks

Yue Liu, Zhiyuan Hu, et al. · 2026/2/20

KLong 开辟了解决超长程任务的新路径。研究团队利用 trajectory-splitting SFT 技术解决了长轨迹训练中的上下文丢失问题。随后通过渐进式 RL 训练,模型在 PaperBench 和 MLE-bench 等榜单上表现卓越。106B 规模的 KLong 甚至超越了参数量更大的 Kimi K2 Thinking。该框架提升了 Agent 执行效率,展示了强大的泛化能力。它是构建工业级自主 Agent 的重要参考。 [link]

Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents

Haiyang Xu, Xi Zhang, et al. · 2026/2/20

GUI-Owl-1.5 模型家族为跨平台 GUI 交互树立了标杆。它支持从桌面到移动端的全场景操作,引入了混合数据飞轮机制。研究者提出的 MRPO 算法有效解决了长路径任务中 RL 训练效率低下的痛点。该模型在 OSWorld 和 AndroidWorld 等 20 多个基准测试中刷新了纪录。这种云边协同的实时交互能力,让 AI Agent 具备了替代人类处理日常数字工作的潜力。 [link]

One-step Language Modeling via Continuous Denoising

Chanhyuk Lee, Jaehoon Yoo, et al. · 2026/2/20

离散扩散模型在生成质量与速度之间的权衡难题被 FLM 攻克。通过在 one-hot 编码上执行 Euclidean denoising,FLM 实现了比传统方法更稳健的训练过程。蒸馏后的 FMLM 仅需一步即可生成高质量文本。实验证明其单步生成质量优于 8 步采样的现有模型。这标志着语言模型生成效率的重大飞跃。对于追求极致响应速度的实时应用,该研究极具工程价值。 [link]

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

Arnold Cartagena, Ariane Teixeira · 2026/2/20

文本输出安全不代表工具调用安全。GAP 基准测试揭示了 LLM Agent 中存在的这种危险分歧。研究发现即便模型在文字上拒绝了有害请求,底层工具仍可能执行禁忌操作。这种 GAP 指数衡量了模型对安全对齐的依从性。研究涵盖了金融、医疗等六大受监管领域。它提醒开发者,仅靠文本层面的防御不足以应对 Agent 带来的现实风险,必须加强动作级的治理。 [link]

EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

Sushant Mehta, Logan Ritchie, et al. · 2026/2/19

AI Agent 能否胜任真实职场工作?EnterpriseBench 给出了严苛的考量。核心环境 CoreCraft 模拟了包含 2500 个实体和 23 种工具的客户支持组织。研究团队利用 GRPO 算法和自适应剪裁技术训练出的模型,展现出了卓越的跨域泛化能力。即便面对从未见过的任务,模型胜任率依然显著提升。这种高保真仿真环境为开发具备专业技能的 Agent 提供了宝贵的训练场。 [link]

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

Nivya Talokar, Ayush K Tarun, et al. · 2026/2/19

单轮提示词攻击已成过去。STING 框架针对多轮交互中的隐蔽意图提供了自动化红队测试方案。它通过分步构建计划并动态调整追问方式,成功诱导 Agent 完成有害任务。实验显示 STING 的攻击成功率远超基准方法。在跨语言测试中,它揭露了低资源语言环境下的安全死角。对于负责 Agent 部署的安全团队,这套评估体系是加固多轮交互防御的必备工具。 [link]

OpenSage: Self-programming Agent Generation Engine

Hongwei Li, Zhun Wang, et al. · 2026/2/20

传统的 Agent 开发高度依赖人工设计。OpenSage 实现了从人造到 AI 自造的范式转变。作为首个支持自生成拓扑和工具集的开发套件,它赋予 LLM 创建和管理子 Agent 的权利。分层图记忆系统确保了信息流转的高效性。在软件工程等复杂任务中,OpenSage 构建出的 Agent 表现优于主流商业方案。它极大地降低了定制化智能体的技术门槛。 [link]

References Improve LLM Alignment in Non-Verifiable Domains

Kejian Shi, Yixin Liu, et al. · 2026/2/20

面对缺乏客观标准的对齐任务,参考信息成了救命稻草。该研究证明利用高级模型产生的参考输出,可以显著提升弱模型作为裁判的准确度。这种软校验机制开启了非验证领域对齐的新方向。实验显示基于参考信息的自我改进效果可媲美 ArmoRM 等强奖励模型。在 AlpacaEval 等榜单上,模型获得了大幅的性能增益。这是后训练阶段提升模型表现的一项技术突破。 [link]

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

Wenxuan Ding, Nicholas Tomlin, et al. · 2026/2/19

在不确定的环境中,Agent 必须权衡探索成本与回报。CTA 框架通过引导 LLM 显式推理成本与不确定性,优化了决策策略。例如在编程任务中,模型会判断是否值得运行测试代码以确保正确性。即便是经过强化学习训练的模型,叠加 CTA 后仍能获得增益。这种让 AI 具备经济账意识的方法,能有效减少长任务中的资源浪费,显著提高任务成功率。 [link]

Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability

Shashank Aggarwal, Ram Vikas Mishra, et al. · 2026/2/20

传统的 CoT 评估过于迷信最终答案。这项研究提出了重用性和可验证性两个核心指标。通过将推理生成与执行解耦,研究者发现专门的推理模型在逻辑质量上未必优于通用模型。这是一个出人意料的发现。它挑战了现有排行榜的权威性,为多 Agent 协作系统提供了更科学的选择依据。对于构建复杂的检索增强流水线,这项评估框架提供了全新的视角。 [link]

BleepingComputer 新闻

PromptSpy is the first known Android malware to use generative AI at runtime

Lawrence Abrams · 2026/2/20 6:36

研究人员发现了首个在运行阶段使用生成式 AI 的 Android 恶意软件。它利用 Google 的 Gemini 模型来调整其在不同设备上的持久化手段。 [link]

Ukrainian gets 5 years for helping North Koreans infiltrate US firms

Sergiu Gatlan · 2026/2/20 17:00

一名乌克兰公民因向朝鲜 IT 人员提供盗取身份而被判处五年监禁。这些身份协助了对方渗透美国公司。 [link]

FBI: Over $20 million stolen in surge of ATM malware attacks in 2025

Sergiu Gatlan · 2026/2/20 18:08

FBI 警告美国去年在 ATM 吐钞攻击潮中损失超过 2000 万美元。罪犯利用恶意软件强制自动取款机吐出现金。 [link]

Mississippi medical center closes all clinics after ransomware attack

Sergiu Gatlan · 2026/2/20 19:50

密西西比大学医学中心在周四遭到勒索软件攻击。该中心随后关闭了其在全州的所有诊所。 [link]

PayPal discloses data breach that exposed user info for 6 months

Sergiu Gatlan · 2026/2/20 21:12

PayPal 正在通知受数据泄露影响的客户。去年贷款申请软件出现错误,导致社会安全号码等敏感个人信息暴露近 6 个月。 [link]

Why the shift left dream has become a nightmare for security and developers

Sponsored by Qualys · 2026/2/20 22:45

左移方法增加了开发者的压力。现代 CI 流水线对速度的要求覆盖了安全检查。Qualys 分析 3.4 万个公共容器镜像后发现 7.3% 具有恶意,安全必须在基础设施层默认执行。 [link]

Data breach at French bank registry impacts 1.2 million accounts

Bill Toulas · 2026/2/21 0:20

法国财政部发布公告通报了一起网络安全事件。该事件影响了 120 万个账户。 [link]

CISA: BeyondTrust RCE flaw now exploited in ransomware attacks

Bill Toulas · 2026/2/21 1:02

黑客正在利用 BeyondTrust Remote Support 产品中的 CVE-2026-1731 漏洞。美国网络安全和基础设施安全局 CISA 警告该漏洞已用于勒索软件攻击。 [link]

Japanese tech giant Advantest hit by ransomware attack

Bill Toulas · 2026/2/21 2:30

Advantest 公司披露其企业网络遭到勒索软件攻击。客户或员工的数据可能已受到影响。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/2/20 6:57 至 2026/2/21 6:51