网安 + AI 前沿日报

2026/5/26 · CyberRadar

网络安全论文

The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems

Tanzim Ahad, Ismail Hossain, et al. · 2026/5/25

AI 智能体出现违规行为,真的是模型对齐出问题了吗?这项研究揭示了名为 Misattribution Gap 的隐患。黑客通过攻击记忆层,让智能体表现出无法与模型故障区分的破坏行为。语义规范漂移攻击利用向量数据库注入恶意文档,导致防御者针对错误的对象进行修复。研究者提出的 Counterfactual Composition Testing 能以 87.5% 的准确率揪出幕后黑手。它为多智能体系统的安全审计提供了全新的法医工具。 [link]

Prompt Overflow: What the Guardrail Inspects Is Not What the Model Infers

Yuanbo Zhou, Changjia Zhu, et al. · 2026/5/25

护栏模型保护了 LLM 吗?答案可能让你失望。Prompt Overflow 攻击利用了安全检查窗口与模型推理窗口的不匹配。黑客将恶意指令碎片化,并掺杂在大量正常内容中。这种方式能轻易绕过 Llama Prompt Guard 等主流防御工具。虽然每个片段看起来都无害,但 LLM 最终能完整执行整条恶意指令。这项研究提醒我们,现有的截断或分段检查机制存在致命盲区。防御者必须重新审视上下文处理逻辑。 [link]

CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference

Guanlong Wu, Zhaohan li, et al. · 2026/5/25

为了提高 LLM 推理效率,KV Cache 共享已成为标配。但这种共享也打开了侧信道攻击的大门。攻击者可以通过探测缓存重用情况来推测用户的私密输入。CachePrune 提出了一种隐私感知的高效共享机制。该机制通过对 KV 条目执行细粒度的敏感性屏蔽,避免了禁用共享带来的效率损失。这种方案在杜绝直接泄露的同时,将首字生成延迟降低了 4.5 倍。它让大模型服务商在追求性能的同时,不必以牺牲用户隐私为代价。 [link]

Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks

Vivek Dahiya, Sunny Nehra, et al. · 2026/5/25

最顶尖的大模型能否胜任网络安全任务?实验结果令人担忧。在针对生产级 Web 应用的黑盒测试中,即使是 GPT-4 级别的模型,其漏洞覆盖率也仅为 4% 到 8%。它们经常产生大量误报,且难以独立完成多步攻击链。相比之下,经过专业训练的小模型在特定任务上表现更佳。研究指出,单纯堆砌模型规模无法解决安全问题。垂直领域的知识沉淀和结构化测试流程才是关键。这篇文章为开发安全专用模型指明了方向。 [link]

What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference

Mingyuan Fan, Yu Liu, et al. · 2026/5/25

Split Inference 被认为是保护 LLM 隐私的良药。然而 ActInv 攻击证明,通过中间层激活值重构用户输入并非难事。即使注入高斯噪声或进行稀疏化处理,攻击者依然能实现高保真重构。研究者开发的 PAF 指标量化了不同模型层的抗重构能力。他们发现,隐私脆弱性在各层之间的分布极不均匀。基于这些发现,新的 PriPert 防御方案通过校准扰动方向,显著提升了重构难度。这为分布式模型部署提供了更可靠的安全保障。 [link]

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

Luze Sun, Anshuman Suri, et al. · 2026/5/25

只需在 1000 个微调样本中混入 10 条恶意数据,就能让 LLM 彻底沦陷。PoisonForge 揭示了指令微调阶段面临的任务级投毒威胁。这种攻击极为精准,只会在特定任务中植入攻击者指定的实体偏见。模型在常规评测中表现完美,但在处理目标任务时却会乖乖听命。实验覆盖了 12 个主流开源模型。结果显示,投毒成功率普遍超过 70%。这项研究警告开发者,必须对微调数据的供应链安全保持高度警惕。 [link]

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

Kieu Dang, Phung Lai, et al. · 2026/5/25

闭源 LLM 如何防止被非法克隆?SAFESEAL 为模型产权保护提供了新方案。它是一种基于密钥条件的动态水印技术。该方案利用竞赛采样机制,将语言项替换为上下文感知词汇,同时严格保留命名实体。这保证了模型输出的语义忠诚度和事实准确性。即便遭受对抗攻击,这种水印依然保持极强的检测率。对比实验表明,它的延迟极低且对文本质量几乎无损。对于投入巨资研发模型的厂商来说,这是一道强有力的版权护城河。 [link]

When Youth Enter the Algorithmic Wild: Discovering and Understanding Potentially Harmful Teen Videos on Douyin and Kwai

Shaoxuan Zhou, Yafei Sun, et al. · 2026/5/25

算法推荐如何将青少年推向危险边缘?PHTV-Scout 框架对短视频平台进行了深度体检。研究者通过模拟青少年行为,在抖音和快手采集了近 20 万个视频。调查发现,潜在有害视频的流行率达到 6.11%,其中儿童性剥削内容占比过半。这些内容常利用语义伪装和噪声注入逃避监管。虽然青少年模式效果显著,但低普及率让多数孩子处于不设防状态。这项研究不仅揭示了算法的脆弱性,更为平台治理提供了数据支撑和技术手段。 [link]

Beyond Zero: Enterprise Security for the AI Era

Joseph Valente, Michal Zalewski · 2026/5/25

传统的零信任架构正面临 AI 时代的严峻挑战。Google 提出的 Beyond Zero 愿景试图打破以应用为中心的陈旧模式。这种新架构将信任边界从应用级缩小到了每一个具体的动作。它能以机器速度对人和 AI 代理的资源访问进行细粒度裁决。通过将静态授权与动态 AI 推理结合,企业可以实现每秒数千次的访问调控。这是一场企业安全范式的革命。它让系统具备了自我防御能力,能有效应对日益复杂的自动化攻击场景。 [link]

Adversarial Vulnerability Under Temporal Concept Drift: A Longitudinal Study of Android Malware Detection

Ahmed Sabbah, Mohammed Kharma, et al. · 2026/5/25

Android 恶意软件检测模型在长期运行中往往会失效。这背后的元凶是时间维度上的分布偏移。研究者跨越十年数据,对不同特征表示和分类器的鲁棒性进行了纵向评估。实验表明,随着训练与测试时间间隔拉大,模型在对抗攻击下的表现呈断崖式下降。即便采用滑动窗口重训练策略,也无法完全消除这种性能损耗。这项研究提醒安全从业者,静态的防御评估已经过时。我们需要建立具备时序感知的动态防御体系,应对进化的攻击手段。 [link]

AI 论文

Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving

Kewei Zhang, Jin Wang, et al. · 2026/5/25

针对端到端自动驾驶推理延迟高且轨迹不稳定的痛点,Fast-dDrive 引入了块扩散机制。它在语义单元内进行双向优化,同时严格遵守感知到规划的因果顺序。通过脚手架推断解码和随机轨迹分叉,它在边缘硬件上实现了 AR 架构相当的质量,吞吐量提升了 12 倍。在 nuScenes 等数据集上显著降低了误差,为大参数模型在车辆端部署铺平了道路。 [link]

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

Shubham Agarwal, Alexander Krentsel, et al. · 2026/5/25

分布式系统的一致性验证一直是工程界的难题。IDS 框架通过 agentic LLM 协作,同步合成代码实现与形式化证明。它能从失败中学习并自动迭代推理策略,将专家数月的工作缩短至数小时。在分布式键值存储规范测试中,它实现了 100 % 的成功率,成本比现有方案更低,速度提升了 200 倍。这是迈向工业级自动生成形式化验证系统的重要一步。 [link]

Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning

Sijia Li, Xiaoyu Tan, et al. · 2026/5/25

呼吸机决策支持需要兼顾患者生理动态和医生的个性化风格。VDSS 采用多智能体协作框架,将复杂决策分解为模块化组件,并通过 contextual bandit 算法进行在线偏好学习。它能从医生的拒绝反馈中针对性地重新规划,减少无效交互。在 ICU 回放实验中,该系统显著提升了建议采纳率,展示了医疗 AI 在高风险环境下与人类协作的巨大潜力。 [link]

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

Casey Ford, Madison Van Doren, et al. · 2026/5/25

攻击 multimodal 大模型的风险因语言而异。研究揭示了 Claude 和 GPT-5 等顶尖模型在西班牙语环境下的独特弱点。令人惊讶的是,虽然角色扮演攻击在西班牙语中效果减弱,但视觉诱导的攻击却更易成功。这表明视觉与语言的对齐失效机制是相互分离的。全球部署的模型安全测评必须重新设计,不能简单套用英语环境的测试结果来衡量全球安全性。 [link]

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

Yifan Yang, Ziyang Gong, et al. · 2026/5/25

Agent 的技能文档需要像模型参数一样进行系统优化。SkillOpt 是首个文本空间的 agent 技能优化器。它将技能文档视为外部状态,通过 scored rollouts 驱动精准的编辑指令。引入学习率预算和验证集机制,确保了技能进化的稳定性。在 GPT-5.5 上的实验证明,该方法显著提升了 agent 在代码和数学任务中的成功率,且优化后的技能具有极强的跨模型迁移能力。 [link]

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

Chuyifei Zhang, Hongyu Cui, et al. · 2026/5/25

现有的长文本推理基准测试存在盲区,忽略了任务在文本中位置的影响。CRE 框架通过控制任务位置、填充内容和长度,揭示了长文本模型的衰减现象。部分模型在文本中间位置的准确率会暴跌 88 个百分点,暴露出严重的干扰问题。研究指出,单纯堆砌上下文长度而不进行位置控制,无法真实衡量模型的长距离推理能力。这对后续长文本模型研发与评测具有重要指导意义。 [link]

A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism

Chuanbo Hu, Minglei Yin, et al. · 2026/5/25

孤独症的社会语言障碍诊断高度依赖医生的提问技巧。TPA 框架通过多智能体协作,模拟医生主动推理未观察到的特征并制定临床策略。该系统在真实临床数据上验证了其高保真度。在 484 次评估实验中,TPA 的诊断特征覆盖率达到 82.1 %,远超人类医生的平均水平。这为大规模、标准化的临床辅助筛查提供了极具效率的 AI 解决方案,能够显著降低医疗成本。 [link]

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

Shivam Chourasia, Hitesh Kapoor, et al. · 2026/5/25

在印度等语言复杂的环境中,KYC 实名认证中的姓名匹配面临巨大挑战。SGER 框架通过两阶段课程学习微调大模型。它先训练模型解析姓名的语法语义结构,再进行二分类匹配优化。该系统在 2.5 亿用户的 Dream11 平台正式上线,准确率高达 99.02 %。它证明了课程学习能让通用模型在极度嘈杂的工业级实战场景中,大幅超越 few-shot 提示词工程的效果。 [link]

Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems

Deepak Panigrahy, Aakash Tyagi · 2026/5/25

衡量 agent 的能效不能只看单次推理。EpG 指标将能耗核算单位从单个请求转变为成功的任务目标,涵盖了失败、重试和工具调用的全过程。研究发现,agent 架构带来的调度开销通常是线性执行的 4 倍以上。A-LEMS 框架通过五层流水线精确映射硬件能耗信号。这一新标准为可持续 AI 部署提供了科学依据,推动业界开始关注任务级能效,而非单纯的算力堆砌。 [link]

Query-Adaptive Semantic Chunking for Retrieval-Augmented Generation: A Dynamic Strategy with Contextual Window Expansion

Mudit Rastogi · 2026/5/25

传统的 RAG 块切分方法往往忽略了用户查询的动态语义。QASC 引入了查询感知机制,根据 sentence 与 query 的向量相似度确定种子句。它动态扩展上下文窗口以保持连贯性并进行块级得分聚合。在技术文档测试中,QASC 的 F1 得分达到了 0.85,比固定切分提升了 18 % 以上。这种动态策略有效解决了检索系统中精度与召回率的权衡难题,增强了答案的相关性。 [link]

BleepingComputer 新闻

FBI warns of Kali365 phishing service targeting Microsoft 365 accounts

Lawrence Abrams · 2026/5/25 20:45

FBI 正在就 Kali365 这一 PhaaS 平台发布警告。该平台通过滥用 OAuth device code authentication 劫持 Microsoft 365 账户。它被用于窃取 session tokens 并绕过 MFA。 [link]

Anthropic’s restricted Claude Mythos model may be coming to Claude Code

Mayank Parmar · 2026/5/26 1:07

Anthropic 似乎正在准备公开发布 Mythos 模型。该模型在 4 月份作为受限模型发布。它会对私人和公共软件造成重大安全风险。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/5/25 7:31 至 2026/5/26 7:35