网安 + AI 前沿日报

2026/6/27 · CyberRadar

网络安全论文

Protocol Prying: Systematic Vulnerability Research in the Apple AirDrop and Android Quick Share Proximity Transfer Protocols

Arash Ale Ebrahim, Nils Ole Tippenhauer · 2026/6/26

AirDrop 和 Quick Share 覆盖全球 50 亿设备,其安全性至关重要。研究人员通过逆向工程揭示了这些协议的 7 层状态机。他们开发了 AIRFUZZ 工具,成功在 iOS 和 Windows 等系统发现 6 个高危漏洞。这些漏洞涵盖了预身份验证阶段的拒绝服务和堆溢出攻击。该研究直接推动了多家厂商的技术修复,并获得了 Google 的漏洞赏金。 [link]

Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities

Corban Villa, Sohee Kim, et al. · 2026/6/26

密码学误用是软件安全的顽疾,但常规工具难以有效检测。Chai 系统利用 AI 技术重构了差异化测试方法。它不再局限于审计单一代码库,而是通过追踪依赖图谱来捕获库级别的逻辑缺陷。实验表明,Chai 在 SSL 等关键库中发现了 100 多个此前未知的漏洞。这些库支撑着数以亿计的设备。这项工作展示了 AI 在复杂安全协议自动化分析中的巨大潜力。 [link]

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

Jintao Huang, Fengqing Jiang, et al. · 2026/6/26

AI 智能体能否像人类专家一样审计智能合约?CyberChainBench 提供了一个包含 541 个真实黑客事件的评测基准。它涵盖 9 条主流区块链,通过主网分叉环境进行端到端评估。研究发现顶级模型虽然在漏洞检测上表现出色,但修复代码的成功率仅为 23.4 %。这表明 AI 在理解金融逻辑漏洞方面仍面临严峻挑战。该项研究为评估自动安全审计工具提供了坚实的实验基础。 [link]

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

Inderjeet Singh, Andr\'es Murillo, et al. · 2026/6/26

RAG 系统的安全性正面临多维挑战。MIRROR 框架利用蒙特卡洛树搜索进行自动化红队测试。它引入了新颖性闸门机制,防止攻击载荷简单重复已知的模板。在多模态环境下,该框架对图像毒化攻击的成功率高达 76 %。相比传统方法,它在更低的查询成本下实现了更强的攻击覆盖。这为评估复杂检索增强系统的稳健性提供了标准化工具。 [link]

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

Ying Li, Yanju Chen, et al. · 2026/6/26

当 AI 智能体获得操作文件和 API 的权限时,其行为边界难以约束。VIGIL 框架实现了对智能体技能调用的运行时监控。它将自然语言规范转化为 SMT 约束,能够捕捉跨多次调用的复杂违规行为。在办公文档和工程任务测试中,VIGIL 的违规检测召回率超过了 95 %。这种动态防御机制弥补了静态策略的不足,让智能体在受控范围内安全地发挥作用。 [link]

DroidBreaker: Practical and Functional Problem-Space Attacks on Machine-Learning Android Malware Detectors

Christian Scano, Diego Soi, et al. · 2026/6/26

许多针对恶意软件检测器的攻击在实际环境中并不可用。DroidBreaker 专注于生成既能逃避检测又保持功能完备的恶意样本。它摒弃了粗糙的代码重写,转而采用细粒度的 API 混淆和模块注入技术。测试显示该框架能有效欺骗 VirusTotal 上的商业扫描器。研究人员还开发了运行时追踪对比技术,确保修改后的软件依然能够执行攻击逻辑。该方案兼具隐蔽性和功能性。 [link]

Beyond Takedown: Measuring Malicious Go Module Persistence in the Wild

Minjae Bae, Carter Yagemann · 2026/6/26

Go 语言生态正面临自动化的供应链攻击。攻击者通过重新包装合法模块来植入混淆的下载器代码。研究人员通过 GOAST 扫描器分析了 1230 万条记录,识别出 2289 个恶意版本。调查发现即便源代码从 GitHub 删除,仍有 99.4 % 以上的恶意包残留在代理解析服务器中。这项工作揭示了清理软件生态系统时的技术鸿沟,促使官方删除了上千个风险模块。 [link]

MIRAGE: Protecting against Malicious Image Editing via False Moderation

Anshul Nasery, Ramnath Kumar, et al. · 2026/6/26

现有的图像保护方法往往需要访问模型权重,限制了实际应用。MIRAGE 提出了一种系统层面的防御策略。它不直接干扰生成模型,而是通过添加对抗性扰动触发商业系统的安全审查机制。当恶意编辑尝试处理受保护图片时,系统会自动将其标记为违规。实验验证该方法在 GPT-Image 等闭源 API 上达到了 88 % 以上的成功率。它为个人隐私保护提供了一种有效的路径。 [link]

DKVE: Decentralized Key Validation for End-to-End Encrypted Messaging

Subin Song (Seoul National University, Seoul, et al. · 2026/6/26

端到端加密通讯的公钥验证一直难以在易用性与安全性间取得平衡。DKVE 协议利用用户的社交网络进行交叉验证。当用户获取联系人公钥时,客户端会通过不经意随机函数查询共同好友。这种隐私保护机制能在后台自动检测中间人攻击。模拟实验显示该方法在强关系网络中能识别出 97 % 的异常。它大幅减少了对复杂密钥透明度架构的依赖,有效降低了部署成本。 [link]

TGHE: Template-based Graph Homomorphic Encryption for Privacy-Preserving GNN Inference in Edge-Cloud Systems

Ngoc Bao Anh Le, Thai T. Vu, et al. · 2026/6/26

同态加密通常因为高昂的计算开销难以处理大规模图数据。TGHE 框架通过挖掘交易图中的模板现象解决了这一难题。它将局部计算树规范化,利用 SIMD 并行加速 CKKS 密文推理。在包含数百万节点的金融反欺诈场景中,TGHE 实现了超过 60 倍的加速。该系统确保了敏感金融数据在加密状态下依然能进行高效的 GNN 预测。它让隐私保护下的实时风控成为了可能。 [link]

AI 论文

Autodata: An agentic data scientist to create high quality synthetic data

Ilia Kulikov, Chenxi Whitehouse, et al. · 2026/6/25

AI 智能体正在进化为专业的数据科学家。该研究提出 Agentic Self-Instruct 方法,在法律推理与数学任务中超越传统合成数据方案。核心亮点在于元优化机制,让智能体在创造数据的过程中学习提升数据质量。这种方法将推理算力转化为模型训练的养料。它为解决大模型训练面临的数据枯竭困境提供了极具潜力的工程路径。 [link]

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

Binghai Wang, Chenlong Zhang, et al. · 2026/6/26

验证代码方案通常比生成代码更难。研究揭示了代码智能体面临的验证地平线难题。奖励函数存在 reward hacking 风险。论文对比了四种奖励构建方式,发现没有任何固定奖励能伴随模型能力同步增长。验证机制必须与生成器共同进化。只有这样才能在长程任务中保持忠实度与鲁棒性。 [link]

Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge

Neeraj Yadav · 2026/6/26

RAG 系统在知识更新时面临严峻挑战。当 API 重构或事实变更,模型通常无法区分过时信息与最新事实。MemStrata 引入双时态账本机制,利用确定性的超集规则淘汰陈旧数据。在动态演化知识库测试中,该系统将陈旧事实错误率降至接近 0 %。它在保持极低检索延迟的同时,确保了回答的实效性。 [link]

EGG: An Expert-Guided Agent Framework for Kernel Generation

Yaochen Han, Ke Fan, et al. · 2026/6/26

高性能 GPU kernel 开发可由智能体驱动。EGG 框架模仿专家工作流,将内核生成分解为算法结构设计与硬件特定调整两个阶段。通过多智能体协作管理上下文,它在 KernelBench 与真实负载中实现了比 PyTorch 快 2.13 倍的速度。这种分层优化思路有效缩减了搜索空间。它提升了自动生成代码的可执行性与性能表现。 [link]

The Capability Frontier: Benchmarks Miss 82% of Model Performance

Bradley Fowler, Ryan Smith, et al. · 2026/6/26

单次精度测试往往低估大模型的真实水平。研究引入能力前沿概念,通过帕累托前沿刻画多模型与多样本组合下的最佳表现。在 16 个基准测试中,纠正单模型评估偏见使错误率降低 54 %。在数据分布异构的现实场景中,通过 oracle 路由与多次采样,模型集体表现显著增强。这为模型部署提供了新的成本效益视角。 [link]

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

Yang Gao (Veyon Solutions) · 2026/6/25

自动化的越狱攻击评估器存在严重缺陷。研究发现 LLM 裁判的召回率波动剧烈,且极易被防御包装手法欺骗。白盒攻击甚至能轻易翻转分类器的判定结论。这项工作提醒安全从业者,必须报告裁判的查准率与查全率。引入对抗性检查可以防止评估结果误导决策,这对于构建稳健的安全防御体系至关重要。 [link]

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

Siyi Liu, Aaron Halfaker, et al. · 2026/6/26

事实性评估往往忽略了证据冲突的存在。当参考文本中同时存在支持与反对的信息时,模型极易表现出过度自信。ConflictScore 将响应分解为原子声明,精准量化模型识别证据冲突的能力。实验表明,该指标能有效检测各领域的过度自信行为。它可以作为修正反馈机制,显著提升模型在 TruthfulQA 等任务上的真实性表现。 [link]

Small edits, large models: How Wikipedia advocacy shapes LLM values

Jasmine Brazilek, Maria Navas, et al. · 2026/6/25

维基百科上的小众编辑群体正在重塑 AI 的价值观。仅 125 次编辑就能显著影响大模型的回答倾向。研究者利用梯度数据归因技术,证实模型会将特定主题与这些编辑内容精准链接。这意味着少数人的协同编辑即可量化改变模型处理敏感话题的方式。该发现揭示了训练数据极易受到定向干预。这对模型对齐安全提出了新挑战。 [link]

Context Recycling for Long-Horizon LLM Inference

Derek Thomas · 2026/6/26

长程对话常受限于 context window 的容量。ContextForge 通过结构化查询生成与外部存储检索,实现了高效的上下文回收机制。系统无需重放完整历史记录即可复用之前的计算结果。这在降低 token 消耗的同时保持了医疗咨询等任务的推理质量。这种方案为在有限资源下扩展智能体长程交互能力提供了务实的工程路径。 [link]

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

Kaicheng Zhang, Wen Ge, et al. · 2026/6/26

量化金融智能体的评估需要标准化环境。OpenFinGym 提供统一的健身房环境,涵盖预测、市场模拟、实时交易及欺诈检测。它具备自动化的任务构建流水线,能将学术论文转化为可执行的任务包。利用容器化运行环境,它有效防止了训练测试集泄漏。该框架支持强化学习后训练,为金融 AI 的实战能力提供了科学的评价标准。 [link]

BleepingComputer 新闻

Your First GRC Agent: A Red Teamer's Walkthrough

Sponsored by Anecdotes · 2026/6/26 22:01

AI 不会取代 GRC 分析师,但可以消除大量的重复性工作。Anecdotes 演示了如何构建一个 Agent,用于持续监控控制措施、识别证据缺口并开启修复任务。 [link]

Polymarket customers lose $3 million in supply-chain attack

Bill Toulas · 2026/6/27 2:04

Polymarket 表示将全额赔偿客户损失,金额预计达 300 万美元。由于第三方供应商遭到破坏,黑客在平台的 frontend 注入了恶意脚本。 [link]

Cybersecurity firms targeted by fraudulent OpenAI organization invites

Lawrence Abrams · 2026/6/27 1:49

威胁行为者正在创建冒充合法公司的 OpenAI 租户,并邀请员工加入。这种手段旨在诱导目标在聊天和项目中提交敏感的公司信息。 [link]

CISA sets urgent deadline to fix Cisco flaw exploited in attacks

Bill Toulas · 2026/6/27 3:43

美国 CISA 要求联邦机构在本周日之前修复 Cisco Unified Communications Manager Server 中的一个漏洞。该漏洞目前正被积极利用。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/6/26 7:49 至 2026/6/27 7:39