网安 + AI 前沿日报

2026/7/18 · CyberRadar

网络安全论文

A Measurement Study of AI-Environment Realism Gaps in Malware-Analysis Sandboxes

Zhiyong Sui, Lamine Noureddine, et al. · 2026/7/17

智能沙箱能骗过病毒,却可能骗不过 AI 软件。研究者发现 AI 软件生态会留下独特的环境印记,例如特定的模型缓存和推理服务。他们构建了 AIprint 探测框架,从数百个开源项目中提取特征。实验显示,目前的沙箱后端几乎无法模拟真实的 AI 环境,这为恶意软件规避检测打开了新大门。由于环境不对称带来了对抗优势,这值得每一位安全架构师警惕。 [link]

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

Rabimba Karanjai, Yang Lu, et al. · 2026/7/17

当 LLM 成为安全运营中心的分析大脑时,日志文件竟变成了投毒工具。攻击者将恶意指令埋入网络日志字段,利用 LLM 对长上下文的推理能力实现被动提示注入。即便采用分段注入技术,攻击成功率仍旧惊人。这项研究揭示了受信任指令与不受信任数据之间难以逾越的边界。在把日志喂给大模型之前,防御深度架构是唯一的安全屏障。 [link]

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

Jifeng Gao, Kang Xia, et al. · 2026/7/17

长期记忆让 AI 智能体更贴心,同时也让它变得更脆弱。MemPoison 揭示了攻击者如何利用存储的文件或偏好设置,实现跨会话的持久性攻击。研究者通过三种攻击层级证明,传统的静态一致性检查难以防御复杂的组合式攻击。那些看似无害的记忆片段,在特定条件下会被触发并扭曲智能体的后续行为。这引发了对 LLM 智能体防御策略的重构。 [link]

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

Aadesh Bagmar, Pushkar Saraf · 2026/7/17

开发者信任 AI 编码助手,攻击者却瞄准了项目文档。通过篡改 README 或依赖列表,黑客能引导 AI 助手从恶意仓库安装软件包。这项研究针对主流大模型进行系统评估,发现它们在识别细微的拼写错误攻击时表现尚可,但面对仓库重定向等攻击时几乎全军没收。文档已经成为新型的代码执行向量。我们需要更硬核的安装前确定性验证机制。 [link]

Automated Template-free Synthesis of Instruction-Centric Leakage Contracts for Black-Box CPUs

Elvira Moreno, Tiziano Marinaro, et al. · 2026/7/17

现代 CPU 复杂的微架构让侧信道攻击防不胜防。malcos 作为首个无需模板的自动化工具,能够从黑箱状态的处理器中合成指令级的泄漏契约。它直接在 x86 和 ARM 等主流硬件上进行验证,证明了从真实芯片中学习安全抽象的可行性。这项工作为编写具备侧信道抗性的代码提供了坚实的底层支撑。对于追求极致安全的系统工程师而言,它是破解处理器黑盒泄密的利器。 [link]

FlowGuard: From Signals to Evidence for MCP Security Detection

Baichao An, Pei Chen, et al. · 2026/7/17

Model Context Protocol 让 AI 智能体具备了调用外部工具的超能力,但也带来了严重的注入风险。FlowGuard 摒弃了不靠谱的语义猜想,通过运行时证据来精准捕捉执行类风险。它能自动生成合规探测负载,验证是否存在真实的命令注入或非法文件访问。在面对数千个真实案例的挑战下,该系统展现了极高的检测精度。它为 MCP 生态筑起了一道基于证据的防火墙。 [link]

Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents

Paul Kassianik, Blaine Nelson, et al. · 2026/7/17

单纯追求成功率已经过时,衡量推理成本才是衡量实战价值的关键。这项研究将推理成本引入评估体系,对比了红队攻击与蓝队防御在不同预算下的表现。实验发现,攻击性能可以通过增加计算资源来提升,但 SOC 防护更依赖于精准的工具调用。这种以经济效率为核心的评价标准,引导我们思考如何在自动化攻防中实现实战价值与运营成本的最优平衡。 [link]

Disclosure Divergence: Measuring Privacy Policy and Data Safety Misalignment at Scale

Mst Eshita Khatun, Lamine Noureddine, et al. · 2026/7/17

你的 App 在隐私政策里说一套,在应用商店的标签里却做另一套。研究者对 6051 个 Android 应用进行了大规模审计,发现数据收集与共享的声明存在严重的对齐偏差。敏感的个人信息和设备标识符是这种不一致的重灾区。通过利用 LLM 提取框架和风险评分模型,该研究量化了这种透明度鸿沟。它揭示了移动生态中亟待修补的隐私披露漏洞。 [link]

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

Zefeng Wu, Weiwei Qi, et al. · 2026/7/17

即便使用良性数据微调模型,也可能悄悄瓦解防御防线。DataShield 提出了一种跨模型的共识子空间对齐框架,专门识别微调数据中的潜在风险。它通过语义频谱分解技术,从多个对齐模型中提取安全共识。无论是过滤整条样本还是掩盖细微字段,该方案都能显著降低模型的攻击成功率。它让模型在适应新任务的同时,不必以牺牲核心安全性为代价。 [link]

Fully Automated End-to-End Adversary Emulation from MITRE ATT\&CK Based Cyber Threat Intelligence Using LLMs

Jueon Choi, Seojun Lee, et al. · 2026/7/17

想要防御黑客,先要学会完美模拟黑客。这套端到端框架利用 LLM 从网络威胁情报中自动提取攻击剧本,并具备失败修复能力。它不再依赖人工干预,能够根据执行反馈动态修订攻击步骤。通过对 11 份情报报告的实测,展现了超越现有技术的成功率。这种闭环式的自动化攻防演练,极大压缩了从发现威胁到部署防御的响应周期。 [link]

AI 论文

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

Lingyun Yang, Yuxiao Wang, et al. · 2026/7/17

GPU 内核生成基准测试通常脱离实际,该研究直接从全集群生产推理追踪中提取 440 个算子形状。 AKA 智能体结合剖析驱动的搜索和优化知识库,将零性能的 fallback 转化为超越手工调优的生产级内核。它为解决计算受限、显存富余环境下的 GPU 优化提供了闭环工具,显著提升了硬件算力利用率。该工具在真实工业负载下展现出极高的工程价值。 [link]

Tactile: Giving Computer-Using Agents Hands and Feet

Yong Liu, Zhenyi Zhong, et al. · 2026/7/17

计算机操作智能体常因截图定位不准而失败。 Tactile 为这类智能体装上了手脚,通过整合操作系统可访问性语义、 OCR 文本和视觉回退机制,将混乱的 UI 信号转化为结构化操作对象。这种观察、定位、动作、验证的闭环设计,将任务成功率提升了近 10 %。它让智能体不再盲目点击坐标,而是真正理解并操作软件界面,是实现自动化办公的重要基础设施。 [link]

SmartRAG: Native Graph-Based RAG for Mobile Device

Zhihan Jiang, Meng Li, et al. · 2026/7/17

手机端部署大模型面临隐私与算力的双重挑战。 SmartRAG 实现了一套完全运行在移动设备上的图增强 RAG 框架。它通过 EvoNER 持续学习命名实体,配合三层知识图谱减少对骨干模型的调用。仅需 1.7 B 参数的量化模型,即可在商品智能手机上实现多跳推理。这让轻量化助手在保障数据不出端的同时,具备了抗衡巨型模型的能力,极具商用潜力。 [link]

ReportMedSAM: Guiding Segmentation Through Radiology Reports

Anghong Du, Theodoros N. Arvanitis, et al. · 2026/7/17

放射科报告存在高度语言变异性,导致医学影像分割难以规模化。该框架弃用固定的短语提取,通过可学习的概念库对齐医学视觉语言编码器。它能识别 renal 与 kidney 等临床同义词,并通过 Mixture of Experts 模块动态激活特定任务。这种解耦设计允许在不训练旧组件的情况下添加新专家。它为临床复杂场景下的稳健分割提供了高扩展性方案,能有效减少人工标注负担。 [link]

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

Yuan Gao, Wenting Miao, et al. · 2026/7/17

自动驾驶测试急需符合法规的多样化场景脚本。 Chat2Scenic 首次引入迭代式 RAG 框架,直接从法规描述生成 Domain Specific Language 脚本。它通过交互式聊天界面引导场景微调,并在 123 个来自 NHTSA 等机构的真实场景中验证了有效性。相比传统方法,其编译成功率大幅提升至 76.42 %。它是打通监管条文与仿真测试的关键技术桥梁,对辅助驾驶研发具有现实意义。 [link]

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

Shiyu Ying, Xuejie Cao, et al. · 2026/7/17

支付集成涉及客户端与服务器端的复杂协同,对编码智能体极具挑战。 Alipay-PIBench 提供了 18 个基于真实支付宝产品线的任务案例。基准涵盖功能完成、风险加固等场景,并支持端到端自动化检查。研究发现,接入专门的支付集成 Skill 可将模型通过率提升 10.31 %。它为金融领域编码智能体的能力诊断和结构化引导设立了实战标准,是金融科技自动化的重要进展。 [link]

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

Jek Huang, Jeffery Hsia, et al. · 2026/7/17

自动编码智能体的任务完成声明往往缺乏可靠凭证。 Proof-or-Stop 机制要求智能体在生命周期转换时必须提交可验证的证据。该方法将输出视为声明,通过证据门控控制合并与测试流程。在 9240 个单元的消融实验中,该机制将隐形失效的比例降至接近零。它不依赖特定模型,为大规模软件工程中的智能体管控提供了透明的防御层,有效提升了自主开发系统的安全性。 [link]

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

Oleksii Bychkov · 2026/7/17

搜救任务对无人机群的自主协作要求极高。该研究提出三层分层学习架构,将反射、技能与推理能力有机结合。架构包含 22 个约束合同,从数学上保证了安全性与一致性。 Swarm Meta Cognition 属性使机群能监控自身认知状态并切换策略。实验证明,该方案解决了分层强化学习的 5 大瓶颈。这是迈向复杂动态环境下无人机实战部署的重要进展,为应急响应提供了智能底座。 [link]

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

Mingyu Lee, Akshat Ramachandran, et al. · 2026/7/17

扩散大模型的推理效率受双向注意力机制制约,难以高效复用 KV 缓存。 Polestar 框架利用表征漂移信号作为统一指标,实现了缓存校准与令牌确认。 Polestar-Cache 通过识别陈旧位置进行稀疏刷新,大幅提升了推理速度。在数学与代码任务中,它实现了 3.7 倍的吞吐量提升。这为大模型在有限资源下的高性能部署提供了免训练新路径,对降低在线推理成本具有显著作用。 [link]

T5-CSBoost: Adversarial Perturbation Resistant LLM Fingerprinting

Gayan K. Kulatilleke, Mahsa Baktashmotlagh, et al. · 2026/7/17

AI 生成文本检测器在面对词语替换或指令偏移时常会失效。 T5-CSBoost 通过对比风格增强技术,在解码器嵌入上引入三重损失约束。这种正则化手段使模型学习到具有抗扰性的风格表征,无需修改骨干网络架构。它在处理 90 % 强度的对抗扰动时表现出极强的鲁棒性。该方案为真实对抗环境下的内容溯源与版权保护提供了轻量且高效的工具,极具应用前景。 [link]

BleepingComputer 新闻

CISA urges immediate action on actively exploited Fortinet flaws

Sergiu Gatlan · 2026/7/17 15:03

CISA 周四命令政府机构优先修补 Fortinet FortiSandbox 威胁检测平台中两个已被积极利用的漏洞。 [link]

Windows Server 2022 reach end of mainstream support in 90 days

Sergiu Gatlan · 2026/7/17 17:10

微软宣布 Windows Server 2022 将在 2026 年 10 月到达主流支持终点。此后系统将转入扩展支持阶段,并在未来 5 年内继续接收安全更新。 [link]

US charges two over laundering $43 million from investment fraud

Sergiu Gatlan · 2026/7/17 16:13

美国检察官周四指控一名纽约男子和一名女子参与大型犯罪团伙。该团伙负责洗白通过网络投资欺诈骗局窃取的 4300 万美元资金。 [link]

New Windows LegacyHive zero-day gives hackers admin privileges

Sergiu Gatlan · 2026/7/17 19:05

代号为 Nightmare Eclipse 的安全研究员发布了名为 LegacyHive 的 Windows 零日漏洞利用工具。攻击者利用该工具可以在最新的 Windows 系统中获取管理员权限。 [link]

Ernst & Young discloses data breach after support system hack

Bill Toulas · 2026/7/17 22:55

安永正通知客户一起数据泄露事件。事件起因是其 IT 人员使用的第三方支持工单系统遭到了入侵。 [link]

Inside the Search for "Clean" Residential Proxies for Carding

Sponsored by Flare · 2026/7/17 22:00

住宅代理在信用卡盗刷领域已不再是万能良药。Flare 解释了犯罪分子为何寻求干净的住宅代理,并将其与浏览器指纹、设备配置文件等身份信号结合,以规避现代欺诈检测。 [link]

HollowByte DDoS flaw bloats OpenSSL server memory with 11-byte payload

Bill Toulas · 2026/7/18 1:56

名为 HollowByte 的漏洞允许未经身份验证的攻击者利用仅 11 字节的恶意负载,在 OpenSSL 服务器上触发拒绝服务攻击。 [link]

Abbott Laboratories probes two cyber incidents amid extortion claims

Lawrence Abrams · 2026/7/18 4:45

雅培公司正在调查两起独立的网络安全事件。公司确认其癌症诊断业务的旧版 Exact Sciences 系统存在未经授权访问,同时也在核实有关 LabCentral 门户被入侵且数据被盗的指控。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/7/17 7:22 至 2026/7/18 7:13