网安 + AI 前沿日报

2026/7/14 · CyberRadar

网络安全论文

SherAgent: Scaling Attack Investigation in the Wild via LLM-Empowered Iterative Query-Filter Backtracking

Zhenyuan Li, Zhengkai Wang, et al. · 2026/7/13

现代安全运营中心面临依赖爆炸难题。SherAgent 采用 LLM 驱动的迭代查询过滤回溯范式,成功应对碎片化因果链。它通过动态校准搜索范围,显著缓解了溯源图分析中的路径丢失。在与头部互联网企业合作的真实场景测试中,该系统将调查成功率提升了六成以上。单次调查成本极低,是自动化威胁猎捕的利器。 [link]

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

Junmin Zhu, Siyu Liu, et al. · 2026/7/13

定向模糊测试常因静态分析局限而错失深层漏洞。SeedSmith 构建了模仿安全分析师工作流的智能体管线。它能自主探索代码库并解析间接调用,合成满足崩溃触发条件的种子。在 Magma 等基准测试中,它让 AFL++ 等主流 Fuzzer 的漏洞发现速度提升了十倍以上。这种无需修改 Fuzzer 逻辑的通用增强方案极大降低了安全测试的门槛。 [link]

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Xingzhi Qian, Xinran Zheng, et al. · 2026/7/13

理解恶意软件并非难事,难点在于构建可审计的推断链条。Malaika 框架通过领域、语义和知识三重锚定机制,将 LLM 推理过程与程序证据紧密结合。在 Android 平台实测中,该系统展现出极高的行为重构准确性。它通过智能体协作,为复杂的恶意行为提供了透明的解释路径,而非简单的特征检测。 [link]

Secret Scanner Agent: Extracting Secrets and Access Context from Unstructured Documents

Zixiao Chen, Mariko Wakabayashi, et al. · 2026/7/13

传统工具扫描泄露文档时往往只给出一串密钥,却不说明它能打开哪扇门。SSA 系统利用多智能体协作,同时提取密钥及其关联的访问上下文。它通过检测智能体与复核智能体的配合大幅降低了误报率。面对非结构化文档,其找回率是正则扫描器的三倍以上。这为事故响应人员提供了直接可用的处置依据,显著缩短了修复周期。 [link]

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

Xuan Chen, Chengpeng Wang, et al. · 2026/7/13

智能体技能中的逻辑冲突是隐私泄露的隐形杀手。SLBench 针对技能文件中的前置条件、约束及回退逻辑构建了严苛的评测基准。研究者通过扫描五千多个公开技能,发现逻辑缺陷普遍存在。目前最顶尖的 LLM 依然有七成概率违规。配合 SLGuard 推理增强模块,违规率可大幅下降,为技能驱动的智能体生态划定了安全红线。 [link]

VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents

Katherine Swinea, Kshitiz Aryal, et al. · 2026/7/13

IoT 设备硬件受限且固件陈旧,自动化渗透测试迫在眉睫。VEXAIoT 框架结合了漏洞检测与攻击执行智能体,专门针对 IoT 特有漏洞进行攻防演练。它能根据侦察信息动态规划攻击序列,在 Metasploitable 等环境中的成功率接近百分之百。整个过程耗时不足两分钟,展现了 LLM 智能体在自动化安全评估中的巨大潜力。 [link]

RaMark: Radioactive Watermarking for Generated Tabular Data

Xin Che, Lingyang Chu, et al. · 2026/7/13

攻击者通过重训练生成模型,能轻易抹除表格数据的水印。RaMark 提出了放射性水印理念,将正弦依赖关系嵌入数据分布底层。只要生成模型试图保持数据效用,就不得不保留水印特征。理论与实验证明,这种耦合机制能抵抗各种重训练和数据篡改攻击。它是隐私敏感数据共享场景下实现版权追溯的稳健技术手段。 [link]

Triggering Stealthy Feature Map Backdoors via Physical Fault Injection in Embedded Neural Networks

Steyn Hommes, Vincent Dankbaar, et al. · 2026/7/13

嵌入式神经网络面临硬件故障与算法后门的双重夹击。该研究揭示了一种跨层攻击路径,利用精确的电磁故障注入触发隐藏在特征图中的后门。这种后门在正常运行时保持隐身,唯有通过物理手段操控寄存器时才会激活。针对 Cortex-M4 等主流微控制器的实验证明,现有防御机制极难察觉这种结合了物理特性的隐蔽威胁。 [link]

A Seed for Privacy -- semi-automatic privacy-revealing data reminder in databases and data streams

He Gu, Thomas Plagemann, et al. · 2026/7/13

数据库生产方往往缺乏识别隐私泄露风险的专业能力。pArborist 采用种子增长算法,在静态数据集和动态流中自动构建泄露风险查询。它通过不断裁剪无关查询,在海量组合中精准定位符合 GDPR 监管要求的敏感事件。测试显示其召回率高达九成且流处理延迟极低。这为数据合规流通提供了一套高效的半自动化工具。 [link]

Entropy Bootstrapping for Wireless Embedded Systems

Javier Blanco-Romero, Florina Almenares Mendoza, et al. · 2026/7/13

廉价无线传感器在启动阶段极易出现随机性匮乏。该研究为 ESP32 类设备设计了纵深防御启动路径,整合了 SRAM 初始状态与无线电突发采样。通过一种非对称熵胶囊机制,设备能在获得本地熵之前验证网关分发的种子。这种基于多源熵凭证的准入策略,解决了 IoT 节点启动时的伪随机安全缺陷,强化了底层安全根基。 [link]

AI 论文

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

Peng Kuang, Haibo Jin, et al. · 2026/7/13

PRM 对于推理时缩放至关重要,但极高的计算成本限制了其应用。KV-PRM 直接读取生成阶段产生的 KV cache,将评分成本从平方级降至线性级。在 MATH 和 AIME 等基准中,它将计算开销缩减了 5000 倍。这种高效验证机制为多智能体系统的长程优化扫清了障碍,让实时推理与深度搜索的结合变得触手可及。 [link]

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

Maureese Williams, Dymitr Nowicki · 2026/7/13

当前智能体在复杂规划任务中过度依赖推理,导致高昂成本与随机性。GATS 框架引入分层世界模型,结合 UCB1 树搜索,在推理阶段实现了零 LLM 调用。它在多个挑战性场景中保持 100 % 的成功率,远超 ReAct 等主流方案。通过将知识固化在符号层与统计层,GATS 为构建确定性、高效率的工业级规划方案提供了清晰的工程蓝图。 [link]

Shared Selective Persistent Memory for Agentic LLM Systems

Sanjana Pedada, Aditya Dhavala, et al. · 2026/7/13

多轮工具调用智能体常面临冷启动问题,每次会话都要从零开始。该研究引入共享选择性持久化存储架构,精准提取任务规范、数据模式等上下文。在企业级场景中,这种机制将任务完成率提升至 96 %,并将推理成本降低 97 倍。它通过解耦程序与运行时数据,让 AI 助手具备了长期进化与协作的能力,极大提升了生产力。 [link]

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

Runhan Shi, Quan Zhou, et al. · 2026/7/13

现有医疗基准多为合成对话,无法模拟真实临床中的图文交互。MedRealMM 基于中国互联网医院的脱敏数据,构建了覆盖 64 个科室的大规模多模态基准。该基准引入精细的医生评估准则,着重考量临床安全性和矛盾回复。研究发现图像信息对决策至关重要,揭示了当前模型在规避风险方面的瓶颈。它是多模态医疗 AI 落地真实场景的重要考场。 [link]

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

Nuocheng Yang, Sihua Wang, et al. · 2026/7/13

在智能工厂中,多模型协作通常伴随巨大的通信开销和延迟。LDT-Coord 框架利用轻量化数字孪生技术,将复杂的自然语言协商简化为结构化的时间约束报告。这种方法将通信开销降低了 70 倍以上,且不依赖特定模型的能力。它解决了异构智能体在受限网络环境下的同步难题,确保了物理 AI 系统的实时性,为大规模群体智能的部署提供了支撑。 [link]

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

Saroj Gopali, Bipin Chhetri, et al. · 2026/7/13

针对工业物联网面临的复杂攻击,传统规则监控已力不从心。该研究提出神经代理控制框架,将 LLM 规划器与时间序列基础模型 TimesFM 结合。核心的逆向物理注入机制允许系统在动作执行前模拟其影响,从而拒绝虚假指令。在水处理系统的压力测试中,该框架成功拦截了多次攻击。它为关键基础设施的自主防御建立了物理级安全屏障。 [link]

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

Yumin Heo, Hyeon-gu Lee, et al. · 2026/7/13

知识图谱在自动构建中难免产生错误,工业规模下的验证是一大难题。AgentKGV 框架集成了动态路由与迭代查询改写,通过两阶段训练提升了 RAG 系统的准确性。它利用蒸馏技术将推理能力迁移至小模型,并采用轨迹级 GRPO 优化搜索策略,在保持高 F1 值的同时将搜索调用次数减半。这套方案显著提升了长尾事实的验证能力,是知识管理自动化的重要突破。 [link]

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

Zongxia Li, Zhongzhi Li, et al. · 2026/7/13

现有基准通常关注短任务,忽略了长时交互中的中间进度。该研究推出了包含 46 个长程任务的基准测试,涵盖软件工程、科研实验等领域,执行时间长达数小时。它通过分解子任务提供密集奖励信号,全面捕捉智能体的规划与调试能力。测试结果显示顶尖模型在完美通过率上也仅有 10 % 左右,揭示了当前 AI 在处理复杂工作流时的巨大进步空间。 [link]

CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions

Vanessa Figueiredo, Wilter Franceschi · 2026/7/13

传统可靠性研究往往只关注模型能力,却忽视了推理控制层的作用。CogniConsole 将推理控制外化为结合程序协调与有界推理的结构化接口。实验证明,增强结构化脚手架能系统性降低输出方差与失败率,解决上下文漂移等核心痛点。它将推理时控制提升为一等抽象,为设计高度可预测的交互系统开辟了从单纯增加参数转向优化控制流程的新路径。 [link]

HALO: Hybrid Adaptive Latent Reasoning for Language Models

Micah Zhang · 2026/7/13

为预训练模型增加额外优化计算往往会造成资源浪费。HALO 提出一种混合自适应潜空间精炼方法,利用令牌评分机制,仅对部分关键 token 进行二阶段精炼。在 MMLU-Pro 等基准测试中,HALO 以更少的平均精炼步数超越了固定步数的基线模型。这种灵活的计算分配策略证明了高效推理的关键在于精准优化资源。它为低能耗、高性能的语言模型部署提供了新思路。 [link]

BleepingComputer 新闻

OpenAI temporarily relaxes GPT-5.6 Sol usage limits

Mayank Parmar · 2026/7/13 8:44

由于过去 48 小时内对该公司最强模型的需求激增,OpenAI 正在暂时放宽 GPT-5.6 Sol 的使用限制。 [link]

EU sanctions Russian GRU military hackers over cyberattacks

Sergiu Gatlan · 2026/7/13 19:19

欧盟和英国共同制裁了数十名俄罗斯个人和实体。他们指控俄罗斯协调黑客网络对欧洲各地发动攻击。 [link]

US and allies warn of Russian critical infrastructure attacks

Sergiu Gatlan · 2026/7/13 17:32

美国及其他 8 个国家的网络安全机构发布联合警告。俄罗斯政府黑客正利用存在漏洞且配置不当的路由器渗透关键基础设施网络。 [link]

Breach at the Beach: Play the Ultimate Entra ID CTF

Sponsored by Varonis · 2026/7/13 22:01

通过免费的实战夺旗赛学习攻击者如何滥用 Entra ID。Varonis 创建了 Breach at the Beach 活动,教导防御者在真实场景中调查攻击技术。 [link]

UK charges suspects linked to Russian Coms call spoofing platform

Sergiu Gatlan · 2026/7/13 21:23

英国国家打击犯罪局调查了 Russian Coms 平台。该平台被用于拨打超过 180 万次诈骗电话,目前已有 5 名嫌疑人被起诉。 [link]

CISA warns of actively exploited RCE flaws in Joomla extensions

Bill Toulas · 2026/7/13 23:20

CISA 警告攻击者正利用 Joomla 扩展程序中的漏洞。这些漏洞允许通过任意文件上传实现远程代码执行。 [link]

Lidl discloses online shop breach after service provider hack

Sergiu Gatlan · 2026/7/13 22:19

德国折扣连锁超市 Lidl 通知部分客户其服务提供商遭到入侵。德国、比利时和荷兰客户的个人信息已被窃取。 [link]

New CrashStealer malware poses as Apple crash reporting tool

Bill Toulas · 2026/7/14 3:04

名为 CrashStealer 的新 macOS 恶意软件伪装成 Apple 的崩溃报告工具。它旨在窃取凭据、钥匙串数据和加密货币钱包。 [link]

Japan's largest taxi operator shuts systems after cyberattack

Bill Toulas · 2026/7/14 4:18

日本最大的出租车运营商日本交通宣布其系统遭到入侵。受此网络攻击影响,该公司被迫关闭了部分基础设施。 [link]

Hackers backdoor Jscrambler npm package with infostealer malware

Bill Toulas · 2026/7/14 3:44

Web 安全公司 Jscrambler 披露其 npm 软件包被植入恶意后门。该恶意版本在被发现前已被下载近 1500 次。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/7/13 7:14 至 2026/7/14 7:23