网络安全论文
Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
Yong Yang, Xing Zheng, et al. · 2026/7/1
AI 基础设施的爆发式增长让现有安全工具捉襟见肘。 AI-Infra-Guard 框架填补了这一空白。它将 AI Agent 的攻击面划分为基础架构、协议工具、智能体行为和模型四层。针对每一层,它匹配了特定的检测范式。它涵盖 75 个组件和 1400 多条规则。这是目前首个跨越全栈的开源红队工具。它让开发者能够审计 AI 技能包和供应链,守护 Agent 的生命线。 [link]
Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens
Peizhi Niu, Wenjie Qu, et al. · 2026/7/1
像 OpenClaw 这样拥有系统级权限的 AI Agent 正在改变办公模式。它们常驻后台,掌握凭证、文件和 subtask 调度权。一旦失控,后果远比普通对话模型严重。 SafeClawArena 基准测试针对这类 Agent 提出了全新评估视角。它模仿操作系统安全机制,测试了供应链完整性等四大攻击面。实验发现恶意插件成功率极高。这暴露了当前防御手段的匮乏。该研究为构建安全的智能体系统指明了方向。 [link]
EnclaveX: End-to-End Confidential AI with CPU/GPU TEEs
Robert Schambach (TU Dresden), Quoc Do Le (STACKIT Cloud), et al. · 2026/7/1
隐私数据泄露是企业拥抱 LLM 的最大阻碍。 EnclaveX 打造了从 CPU 到 GPU 的端到端机密计算方案。它整合了 Intel TDX 、 AMD SEV-SNP 以及 NVIDIA H200 的硬件安全特性。在 TEE 环境下,即使 Kubernetes 管理员也无法窥视虚拟机内的敏感代码。该系统在性能损耗与安全性之间取得了平衡。实测数据证明了该方案在工业级场景下的可行性。它让企业可以在无需信任云厂商的前提下部署核心 AI 资产。 [link]
A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems
Seyed Bagher Hashemi Natanzi, Bo Tang · 2026/7/1
如今的 LLM 深入到代码环境、检索链路和自主 Agent 系统中。这篇综述从全生命周期和应用栈的角度,系统化梳理了 LLM 面临的安全挑战。它将攻击划分为数据采集、预训练、对齐等八个阶段。文章不仅讨论攻击名称,更深入探讨了信任边界如何失效。它揭示了单一防御手段往往无法奏效的原因。对于想要全面掌握 LLM 系统安全图谱的研究者来说,这是一篇必读的奠基之作。 [link]
Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense
Mitchell Hermon, Rahul Gupta, et al. · 2026/7/1
抵御提示注入攻击需要付出隐形成本。 SecFid 基准测试揭示了真相。现有的防御手段在屏蔽注入指令时,往往误伤合法的待处理文本。在翻译任务中,这种防御副作用导致任务保真度断崖式下跌。目前的模型无法兼顾安全与保真。研究发现,安全性指标掩盖了防御带来的性能牺牲。通过决策论分析,文中指出防御策略必须根据具体场景灵活调整。这是一份关于 LLM 稳健性评估的清醒指南。 [link]
Beyond Her: Safety Dynamics in Role-play AI Companions
Zehang Deng (Minhui), Zhaoyang Xie (Minhui), et al. · 2026/6/30
电影 Her 中的情感 AI 已经照进现实,但其安全隐患远超想象。该研究聚焦 Role-play AI Companion 用户的安全动态。通过对 102 名用户进行为期 14 天的追踪调查,研究人员发现 AI 互动虽然能提供短期慰藉,却可能掩盖长期的心理恶化。脆弱用户的情绪波动更不稳定,传统的静态防护墙难以应对这种风险。该研究呼吁为下一代 AI 伴侣设计自适应防护机制。它关乎技术稳健性,也深刻影响着人类心理健康。 [link]
Robocalls: A Worldwide or US-only Problem? Analyzing Spam and Fraud in International Phone Calls
Kemal Altwlkany, Andro Mer\'cep, et al. · 2026/7/1
骚扰电话在全球肆虐并造成巨大经济损失。这项涵盖 65 个国家的研究揭开了国际 Robocalls 的面纱。通过分析 870 万条通话记录和数百份录音,研究人员发现了复杂的跨国攻击模式。虽然这是全球性挑战,但美国受到的威胁显著更高。该团队发布了首个多模态国际骚扰电话数据集。通过语言学分析和回调号码提取,他们揭示了攻击者的组织规律。这些实证数据将支持各国政府打击电信诈骗。 [link]
Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures
Bowen Sun, Chaowei Xiao · 2026/7/1
科学文献中的原始数据常被锁死在 PDF 图表里。手动提取费时费力且容易出错。该研究提出了一套针对矢量图的高精度自动提取理论。由于渲染器绘制标记时采用了极高精度,研究人员可以利用反向工程找回近乎无损的原始数值。这种方法无需人工干预即可完成 Forensic Verification 。在对 Keeling 曲线等数据的测试中,提取精度极高。它为科学诚信治理提供了利器。数据跳出了像素点的局限,成为可溯源的科学证据。 [link]
The Decomposition Is the Fingerprint: Per-Component Identity for Agent Skills
Hongliang Liu, Yuhao Wu, et al. · 2026/7/1
当 AI Agent 动态加载技能包时,身份校验成了难题。传统的加密哈希极其敏感,代码微调会导致校验失效。该研究提出了基于 SimHash 的组件级指纹技术。它将 prompt 指令、代码逻辑和工具声明分别映射为固定的 120 字节签名。通过计算 Hamming distance ,系统能精准识别经过转述或重构的技能变体。这种方式不仅定位代码复用,还能有效检测经过篡改的恶意插件。它为 Agent 技能市场构建了高效元数据管理体系。 [link]
Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models
Arash Raftari, Mehrdad Mahdavi, et al. · 2026/7/1
给被植入后门的 LLM 做手术是一项挑战。全量微调成本太高。该研究利用 Fisher 曲率分析,精准定位了模型中传播后门行为的关键模块。通过在这些模块上应用 targeted low-rank repair ,研究人员在不重练模型的情况下成功清除了毒素。测试表明,这种方法在抑制恶意响应的同时,几乎不影响模型的正常功能。它将后门移除转化为局部结构修复问题。这种轻量级的模型净化方案极具工程实操价值。 [link]
AI 论文
Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2
Johan Land · 2026/7/1
面对号称人类水平智能试金石的 ARC-AGI-2 挑战,这款求解器拿下了 72.9 % 的惊人分数。它摒弃了单调的提示词模板,转而将 text、image、code 视作独立的搜索算子。通过长上下文进行整体评判,它能从大量答案中精准找回正确的少数派假设。这种多模态切换机制击败了 GPT-5.2 Pro 等顶尖闭源模型。它证明了推理多样性才是攻克逻辑难题的关键。源码现已完全公开,为实现 AGI 提供了新的工程思路。 [link]
Xiaomi-GUI-0 Technical Report
Wanxia Cao, Chengzhen Duan, et al. · 2026/7/1
小米发布的移动端多模态智能体 Xiaomi-GUI-0 真正走向了真实设备环境。它不依赖离线轨迹,而是在真实手机的闭环中完成训练。通过构建错误驱动的数据飞轮,该智能体能够敏锐识别权限弹窗、风险控制等异常状态。这种混合架构显著弥合了测试集与日常体验之间的代沟,让 AndroidWorld 的成功率跃升至 78.9 %。它为智能体从实验室走向千万用户的手机提供了落地的技术蓝图。 [link]
One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
Jie Ma, Binfei Chu, et al. · 2026/7/1
自主科学研究智能体 SAGE 彻底解决了实验失败后的恢复瓶颈。它引入了多假设故障归因机制,将传统的文字反思升级为结构化的因果诊断。面对代码报错或指标异常,SAGE 能自动定位问题层级并执行针对性干预。在十二个科研课题的实测中,它生成的有效成果比例从 42 % 飙升至 92 %,表现超越了著名的 AI Scientist v2。这种具备科学诚信约束的系统架构,为全自动化科研实验奠定了更可信的基础。 [link]
Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering
Yongbin Kim, Yashar Talebirad, et al. · 2026/7/1
机器学习工程师智能体 HASTE 让 AI 告别了冷启动。它设计了一套三层级知识组织架构,能将过往比赛中积累的特征工程和调参技巧跨领域迁移。在 22 项 Kaggle 竞赛的测试中,温暖启动的智能体仅需不到一半的迭代次数即可获得奖牌。这种分层加载机制让知识组织替代了对算力和模型强度的部分依赖。研究展示了如何通过高效的经验管理,让 AI 智能体在处理复杂的现实工程任务时表现得像专家。 [link]
CryoACE: An Atom-centric Framework for Accurate and Automated Model Building in Cryo-EM
Minzhang Li, Mingrui Li, et al. · 2026/7/1
结构生物学研究迎来重要工程突破。CryoACE 框架实现了高精度冷冻电镜密度图的自动化原子建模。它开创性地采用了以原子为中心的重建范式,直接在原子坐标处采样特征,有效避免了高昂的体素卷积开销。面对蛋白质分子的动态异质性,系统利用预测的局部分辨率先验进行无训练引导。它在真实数据集 EMPIAR-10345 上首次揭开原子级动态构象。这一工具将极大加速药物发现和蛋白质机理研究的进程。 [link]
A Single Rewrite Suffices: Empirical Lessons from Production Skill Description Optimization
Yangqiaoyu Zhou, Mohammad Alqudah, et al. · 2026/7/1
针对企业级 AI 智能体在多技能路由中的冲突问题,这项研究给出了一套生产环境下的优化方案。当技能描述出现重合时,传统的路由机制往往会产生错误。该团队部署的自动优化流水线利用 False Positive 与 False Negative 案例进行单次重写。在包含 9 种技能的真实客服场景中,这一方法将每项技能的工程耗时从 120 分钟骤降至 3.8 分钟。它证明了模型重写结合错误反馈,就能达到甚至超越专家级的人工调优效果。 [link]
Test-Time Verification for Text-to-SQL via Outcome Reward Models
Mattia Tritto, Giuseppe Farano, et al. · 2026/7/1
结构化推理任务 Text-to-SQL 的可靠性获得重要提升。GradeSQL 框架引入了学习型的语义评分函数,用于在推理时对候选 SQL 进行验证。它通过自动生成的候选集和基于执行结果的标签,在无需人工标注的情况下训练任务特定的结果奖励模型。在 BIRD 和 Spider 基准测试中,这种验证驱动的流水线显著优于传统的执行成功检查。它展示了如何通过轻量级的语义判别器,让开源模型在大规模复杂查询生成中展现出卓越的精确度。 [link]
Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support
Mizanur Rahman, Abeer Badawi, et al. · 2026/7/1
心理健康支持智能体不再只是简单的聊天机器。TheraAgent 框架将治疗性回复的生成转化为决策优化问题。首先训练的评估器 TheraJudge 可以在安全、共情等维度给出专家级的判断。随后,由评论员、教练和治疗师组成的智能体团队根据这些反馈协同修正回复。实测显示,该系统让低质量回复的恢复率达到 94 %,显著提升了辅助支持的质量。它为构建符合职业伦理的医疗级 AI 系统提供了严谨的工程范式。 [link]
AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance
Yang Zou, Zijian Ding, et al. · 2026/7/1
AgRefactor 系统为高层次综合代码的自动化重构开辟了新路径。针对软件代码转化为硅片设计时存在的兼容性难题,该系统构建了具备自我演进记忆的多智能体流。它巧妙平衡了大规模模型重写与高效的工具化转换,处理的代码长度比以往研究高出五至十倍。在多个极具挑战性的硬件基准测试中,它实现了 6.51 倍的几何平均加速。这一全自动开源工具缩小了软件编程与硬件实现之间的鸿沟,加速了芯片落地的过程。 [link]
Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale
Alessandro Morosini, Sarah H. Cen, et al. · 2026/7/1
算法审计工作有了强大的自动化引擎。研究人员利用具备固定 Persona 的生成式 AI 智能体,对 X 的推荐算法进行了大规模黑盒审计。这些智能体基于真实的人口统计和政治调查数据构建,能在干扰下模拟真实用户的交互。通过对大选期间超过 200,000 次内容曝光的分析,研究揭示了平台如何根据用户意识形态放大极端内容。这种反事实审计框架,为监管复杂算法系统提供了一种高效且可扩展的新工具。 [link]
BleepingComputer 新闻
Anthropic rolls out Sonnet 5 with near-Opus 4.8 performance at a lower price
Mayank Parmar · 2026/7/1 7:13
Anthropic 正在推出 Sonnet 5。其性能几乎达到了 Opus 系列的水平,但价格比该公司的旗舰模型更低。 [link]
Anthropic to restore Claude Fable access on Wednesday
Mayank Parmar · 2026/7/1 8:35
Anthropic 确认商务部已取消对 Claude 两个最强模型 Fable 5 和 Mythos 5 的出口管制。 [link]
Adobe patches seven max severity ColdFusion, Campaign flaws
Sergiu Gatlan · 2026/7/1 15:34
Adobe 发布了安全补丁,修复了 ColdFusion Web 应用开发平台和 Campaign Classic 营销自动化平台中的 7 个最高严重程度漏洞。 [link]
Microsoft fixes GIF functionality in the Windows Emoji Panel
Sergiu Gatlan · 2026/7/1 18:52
在服务提供商关闭服务后,微软修复了 Windows 11 和 Windows Server 用户表情符号面板中的 GIF 功能。 [link]
Amazon fined $2.25M for withholding evidence from fraud victims
Sergiu Gatlan · 2026/7/1 17:43
美国联邦贸易委员会表示,亚马逊将支付 225 万美元的民事罚款。此次和解针对的是亚马逊阻碍身份盗窃受害者获取交易记录的指控。 [link]
Over 900 Oracle E-Business instances exposed to ongoing attacks
Sergiu Gatlan · 2026/7/1 20:30
超过 900 个 Oracle E-Business Suite 实例被发现暴露在互联网上,正面临利用关键安全漏洞的持续攻击。 [link]
Webinar: Why traditional email security is no longer enough
BleepingComputer · 2026/7/2 0:54
现代钓鱼、商业邮件诈骗和账户接管攻击正利用受信任的身份和合法的业务流程。传统邮件防御手段很难检测到这些威胁。本次研讨会将探讨行为 AI 如何帮助组织自动化执行检测与响应。 [link]
Hackers target Microsoft 365 accounts with 81 million login attempts
Bill Toulas · 2026/7/2 0:38
针对 Microsoft 365 环境的激进口令喷射活动在两周内生成了超过 8100 万次登录尝试。 [link]
Turning Indicators into Intelligence in OpenCTI with Criminal IP
Sponsored by Criminal IP · 2026/7/1 22:01
威胁情报的价值取决于其背后的上下文。Criminal IP 解释了其集成插件如何通过风险评分、基础设施情报和钓鱼分析来增强 OpenCTI 中的威胁指标。 [link]
DHS confirms hackers breached HSIN info-sharing platform
Lawrence Abrams · 2026/7/2 1:32
美国国土安全部正在调查一起网络攻击。该攻击入侵了 HSIN 信息共享平台。该平台供联邦、州、地方和私营部门合作伙伴分享敏感信息。 [link]
Kubota says hackers had month-long access to network systems
Bill Toulas · 2026/7/2 5:09
Kubota North America Corporation 披露,黑客在今年早些时候访问了其部分网络系统,时间超过一个月。 [link]
New ChocoPoC malware targets researchers via trojanized PoC exploits
Bill Toulas · 2026/7/2 4:08
GitHub 上发现多个被武器化的 PoC 漏洞利用程序。这些程序会分发名为 ChocoPoC 的 Python 远程访问木马,可执行命令并窃取敏感数据。该活动被认为针对安全研究人员。 [link]
FortiBleed credential-theft campaign linked to Lynx ransomware
Lawrence Abrams · 2026/7/2 5:37
大规模的 FortiBleed 凭据窃取活动已被关联到 INC 和 Lynx 勒索软件操作。这表明被盗的 Fortinet 凭据被用于支持未来的网络入侵。 [link]