网络安全论文
Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware
Zimo Ji, Congying Xu, et al. · 2026/7/3
编程智能体依赖的第三方技能库正成为供应链攻击的新温床。研究者提出的 SkillCloak 框架通过结构混淆和自我解压包装,让现有扫描器在恶意代码面前集体失效。与之对抗的 SkillDetonate 则不再纠结于静态代码特征,它利用沙箱环境监控运行时指令流。通过标记敏感数据的跨进程流动,该系统即便面对高强度混淆也能精准识别恶意意图,攻击检测率高达 97 %。 [link]
Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems
Qiang Han, Jie Wu, et al. · 2026/7/3
集成视觉语言模型的机器人系统正面临一种隐蔽的性能威胁。攻击者通过在物理场景中嵌入精心设计的文本触发器,能够诱导模型产生过度思考行为。这会导致模型推理时间剧增,最严重时可使决策延迟放大至 6.96 倍。研究表明,这种攻击在黑盒场景下依然具备极强的迁移性。这种通过消耗计算资源来瘫痪机器人反应能力的物理攻击手段,为自动驾驶与协作机器人的安全设计敲响了警钟。 [link]
Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
William Hackett, Peter Garraghan · 2026/7/3
在黑盒攻击生产环境的大模型时,区分系统拒绝是来自模型自身对齐还是外部防护组件至关重要。研究者提出一种基于行为监测的探测方法,通过分析 HTTP 响应、词法特征与响应耗时信号,能够以 100 % 的准确率识别防护组件的存在。该技术无需任何先验知识,仅凭外部观察即可推断防护策略拦截的敏感类别。它不仅提升了红队渗透测试的效率,也暴露出当前 AI 基础设施在行为特征隐藏方面的短板。 [link]
Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates
Mohsen Salehi, Karthik Pattabiraman · 2026/7/3
工业控制系统遭遇内存破坏攻击通常只能被迫停机,这在关键任务中可能引发灾难。Chameleon 框架为这一难题提供了新思路。它利用机器学习训练出功能等效的替代组件,这些组件具备天然的免疫特性。当监测到原始模块被劫持时,系统会自动热切换至替代组件。在七种机器人车辆上的实验证明,该方案能以极低的性能开销维持系统运行。它让受攻击的硬件系统具备了像变色龙一样的自我修复能力。 [link]
Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
Michele Guida, Ruslan Shikhhamzayev, et al. · 2026/7/3
传统的大模型安全防护往往只针对单次对话,难以抵御多轮诱导攻击。Cognitive Firewall 提出了一种零信任架构下的多重门控防御方案。该框架将安全评估分解为意图识别、权限验证、跨轮一致性检测以及输出风险过滤四个维度。不同于常见的得分加权方式,它采用升级机制处理信号,只要任意一环触发警报即可拦截。实验显示它将人类精心构建的攻击成功率降至 14 % 以下,为复杂交互场景下的模型部署提供了稳健的屏障。 [link]
Knowledge Over Parameters: Evolving Smart Contract Vulnerability Detection
Yuqiang Sun, Han Liu, et al. · 2026/7/3
检测智能合约的逻辑漏洞一直面临标注样本匮乏的挑战。EvoVuln 另辟蹊径,将漏洞识别转化为程序化知识的进化问题。它利用控制反转架构将确定性的控制流与模型语义推理分离,仅需极少量样本即可自动进化出检测规则。这种进化出的策略具有极强的跨模型可移植性,能让轻量级模型达到甚至超越大型模型的检测水平。不到 50 美元的演化成本,为智能合约的大规模自动化安全审计开辟了经济高效的新路径。 [link]
Embedding Inference Attack
Cedric Fitiavana Raelijohn, S\'ebastien Gambs, et al. · 2026/7/3
嵌入模型是现代检索系统的核心,即便隐藏在接口后也并非绝对安全。研究者揭示了一种名为嵌入推断攻击的新型威胁,攻击者仅需观察系统返回的无序文档集合,即可推断出后端运行的具体模型。这种攻击在黑盒环境下表现优异,甚至能绕过重排序机制的干扰。在真实的检索增强生成系统中,攻击者利用构造的查询即可获取敏感的配置信息。该发现提醒开发者需要通过设置相似度阈值等策略,强化系统内部组件的隐私保护。 [link]
VeriChat: An Agentic Conversational AI Assistant for Hardware Security Verification
Dipayan Saha, Khan Thamid Hasan, et al. · 2026/7/3
硬件安全验证通常需要专家操作复杂的电子设计自动化工具,门槛极高。VeriChat 是一款垂直领域的智能助手,它采用多智能体协作流,能有效抑制大模型的幻觉现象。该系统集成了多种开源工具,用户通过自然语言对话即可直接对寄存器传输级代码进行仿真、综合及形式化验证。在针对加密芯片漏洞的实测中,它自主完成了漏洞识别与证明。这种将专家经验与自动化工具链深度融合的模式,显著提升了硬件 IP 核的审计效率。 [link]
Trust Boundary Semantic Gaps: A Multi-dimensional Analysis and Mitigation for Security-by-Design
Doyeon Kim, Jin-Young Choi, et al. · 2026/7/3
即便通过了格式校验与身份鉴权,跨越信任边界的工件依然可能埋下隐患。研究者定义了信任边界语义间隙这一概念,指出语法验证无法覆盖复杂的安全语义要求。通过回溯包括太阳风在内的 75 起重大安全事故,该研究构建了涵盖身份、空间、时间和解释四个维度的分析模型。配套的 TBSAM 框架能在设计阶段精准识别这些隐隙并推导防护措施。这一成果推动了从简单的边界防御向深层的语义一致性验证转变,完善了安全设计理论体系。 [link]
Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map
Gabriel Hurtado · 2026/7/3
如何识别一个开源大模型是否被恶意剥离了安全防护层?研究者开发了一套基于激活间隙与权重能量的审计方案。通过对比待测权重与参考基准的差异,该方法无需运行模型生成内容,即可在静态阶段判断其是否被去对齐处理。实验覆盖了包括 Llama 和 Qwen 在内的数百个模型微调版本,检测准确率极高。虽然白盒攻击者仍有绕过可能,但该审计工具为模型仓库的自动化合规初筛提供了高效手段,是开源生态治理的重要技术补充。 [link]
AI 论文
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
Yunhao Feng, Ruixiao Lin, et al. · 2026/7/3
LLM 智能体在执行外部工具时面临复杂的安全风险。Vera 借鉴软件工程测试原则,构建了一套端到端的自动化安全测试框架。它通过组合不同维度的风险分类法,生成可执行的安全测试案例,并在隔离的沙箱环境中对智能体进行压力测试。该框架不仅能发现潜在攻击,还通过环境状态和工具调用证据进行确定性验证。它是大规模评估智能体系统安全性、提升生产环境可靠性的关键基础设施。 [link]
Theoria: Rewrite-Acceptability Verification over Informal Reasoning States
Michael Saldivar, Ben Slivinski · 2026/7/2
当 AI 生成答案时,我们该如何完全信任它?Theoria 提供了一种新型验证架构,将候选解决方案重写为一系列可独立审计的状态转换。每一个步骤都必须有明确的依据,无论是文献引用还是计算结果。这种方法消除了隐藏的前置假设,让复杂的推理过程变得透明且可挑战。实验表明,它在处理对抗性误导和虚假引用方面具有极高的精度。这是实现可信人工智能的重要技术突破。 [link]
Office Comprehension Benchmark
Firoz Shaik, Mateus Pican\c{c}o Lima Gomes, et al. · 2026/7/3
办公文档的处理一直是 LLM 面临的痛点。OCB 填补了这一空白,它是首个专门评估模型对原生 Word、Excel 和 PowerPoint 格式理解能力的公开基准。它不仅测试模型对表格、公式和图表等静态内容的感知,还考察跨文档的多步推理和综合分析。即使是当前的顶尖模型,在复杂的行业领域 Q&A 中也面临巨大挑战。该基准为构建更智能的自动化办公助手指明了方向。 [link]
Kara: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression
Shen Han, Yuyang Wu · 2026/7/3
推理大模型生成的超长思维链会消耗海量的 KV cache 空间,导致推理延迟激增。Kara 提出了一种滑动窗口 KV cache 压缩方案,只针对最近生成的上下文进行实时处理。它利用双向注意力机制识别重要的语义块,并灵活地保留变长信息。配合专为 PagedAttention 优化的推理框架 KvLLM,该技术显著降低了内存占用并提升了吞吐量。它是高效率部署大参数量推理模型的理想选择。 [link]
Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
Mingzhe Du, Luu Anh Tuan, et al. · 2026/7/3
在仓库级别复现代码漏洞是一项极具挑战性的任务。Mastermind 提出了一种双向循环框架,将可迁移的策略学习与具体的执行任务解耦。规划器通过强化学习掌握复现漏洞的高级策略,而执行器负责具体的代码修改和验证。这种设计允许规划器在不改变执行器底层能力的情况下,指导模型在庞大代码库中精准定位漏洞并生成 PoC。在多个复杂环境下的高成功率证明了其在自动化软件安全领域的巨大潜力。 [link]
Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model
Junyan Tan, Haoran Lin, et al. · 2026/7/3
随着云原生架构日益复杂,服务故障的自动修复变得至关重要。PASE 将故障恢复重新定义为一种神经符号程序合成任务。它通过 LLM 生成结构化的恢复计划,并利用神经符号世界模型在模拟环境中验证可行性。这种紧凑的推理、计划、验证、适配闭环,使得系统能动态应对未知的故障场景。实验数据表明,该方案能大幅缩短云服务恢复时间,为构建高可靠的自主运维系统提供了核心技术支撑。 [link]
Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale
Siddharth Gollapudi, Nilesh Gupta, et al. · 2026/7/3
如果能直接在百万 token 的上下文中进行检索,现有的检索流水线将被彻底重塑。BlockSearch 针对超大规模上下文检索中的注意力稀释问题进行了深度优化。它引入了长度感知的注意力 Softmax 调整机制,有效抑制了无关文档对得分的影响。即便在模型规模较小的情况下,它在海量语料上的表现依然能媲美传统的稠密检索器。这项研究让在超长上下文内直接进行精准信息提取成为了可能。 [link]
Discrete Diffusion Language Models for Interactive Radiology Report Drafting
Max Van Puyvelde, Halil Ibrahim Gulluk, et al. · 2026/7/3
放射科报告通常高度简练且具有特定格式。DiffusionGemma 放弃了传统的自回归生成模式,转而采用离散扩散模型来生成文本。这种双向去噪机制赋予了模型一种全新的能力:任意顺序的插值填空。放射科医生可以固定报告中的某些片段,让模型根据上下文自动补全剩余部分。这种交互式的文档编写方式更符合临床实际需求,且生成速度大幅领先于同类模型。 [link]
Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation
Junyi Wen, Ruiyan Zhuang, et al. · 2026/7/3
为专用芯片 NPU 编写高性能算子是当前算力部署的瓶颈。Hawk 框架通过集成硬件感知知识,解决了 LLM 生成算子代码时容易触发运行崩溃的问题。它利用运行时知识合成模块,将错误上下文与可执行语义耦合。配合瓶颈感知检索和效果驱动的知识蒸馏,Hawk 能在不经过梯度微调的情况下,显著提升算子生成的准确性,并获得翻倍的执行加速。它是释放底层硬件性能、加速模型推理的工程利器。 [link]
Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
Haonan Huang · 2026/7/3
科学研究中的自动化探索往往受困于虚假的引用和无法验证的推导。该研究展示了一个全自动的物理学研究流水线,实现了从原始论文库到高质量学术手稿的转化。其核心在于建立了一套容错机制,通过在多个校准点强制对齐物理文献数据,确保了计算结果和方法论的真实性。该流水线不仅能自主构思研究方向,还能复现已有成果并开展原始计算。这标志着 AI 在高门槛基础科学领域正迈向真正的自主探索。 [link]