网安 + AI 前沿日报

2026/8/14 · CyberRadar

网络安全论文

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

Jeremy Spence, Nicholas Assaderaghi, et al. · 2026/8/13

大语言模型在分析源码时表现出色,但在处理二进制文件时却陷入困境。本文推出了 SRE-Bench,这是首个专注于逆向工程的无污染基准测试集。研究者邀请专家耗时 5000 小时编写了 19 个真实的私有程序,总计包含 262 个二进制实例。实验结果显示,即便是最顶尖的 GPT-5.6-sol 也没法完全解决这些复杂的逆向任务。这为安全智能体进入底层软件分析领域指明了方向。 [link]

Agent Safety Should Be a Runtime Contract

Albus W. Ng, Yi Han, et al. · 2026/8/13

靠训练阶段的对齐来保证 Agent 安全已经不够用了。研究者提出将安全视为一种运行时契约。这种契约包含预防和证据两个侧面。预防侧通过 Sandbox 和权限网关拦截危险动作,证据侧则要求智能体提供日志和 Diff 记录。通过对 28560 篇顶会论文的审计,作者揭示了学术界在部署侧防御研究上的严重不足。安全的核心单位应该是轨迹证据而非模型本身。 [link]

Plaintext Recovery Against Post-Filtering Access Control

Zachary Espiritu (MongoDB Research), David Cash (University of Chicago) · 2026/8/13

行级安全 RLS 真的安全吗?本文揭示了主流数据库中广泛存在的侧信道风险。攻击者可以利用 PostgreSQL 的查询耗时或者 Elasticsearch 的评分机制来暴力还原高熵数据。作者展示了如何通过简单的范围查询将成员资格测试放大为完整的记录恢复攻击。这种攻击会影响多租户环境,并威胁到组织内部的最小权限执行策略。研究结果迫使开发者必须重新评估复杂谓词下的访问控制安全性。 [link]

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

Guang Yang, Fengchen Liu, et al. · 2026/8/13

多模态模型的审查正变得越来越隐蔽。本文对九个主流 Vision-Language Models 进行了系统性的审计。研究发现,当使用中文 Prompt 诱导时,模型发生状态对齐框架重塑的概率会增加两倍。审查行为已经从显式的拒绝回答进化为流畅的叙事重构。这种隐形的框架重塑让用户难以察觉信息被过滤,增加了人机交互中的认知风险。该研究为理解多模态系统的合规性偏见提供了量化依据。 [link]

Battlefield 5G: Dual-PKI and TPM-Based UE Attestation for Tactical 5G Standalone Networks

Al Nahian Bin Emran, Rajendra Paudyal, et al. · 2026/8/13

战场环境下的 5G 基站面临设备捕获和固件篡改的严峻威胁。Battlefield 5G 方案在标准 5G-AKA 协议基础上,引入了基于 TPM 的硬件完整性度量。它通过双重 X.509 证书挑战确保物理设备与订户凭证的绑定。研究者在 srsRAN 和 Open5GS 的真机环境中实现了这套机制。它能在不改变 NAS 消息结构的前提下,有效拦截 SIM 卡移植和恶意固件攻击,显著提升了战术网络的防御强度。 [link]

Association-based Privacy Attacks in Wireless Protocols: Formal Modeling and Mitigation

Mohit Kumar Jangid, Felix Engelmann, et al. · 2026/8/13

无线协议中的配对机制往往潜伏着严重的隐私漏洞。本文对 Wi-Fi P2P 和蓝牙低功耗的重连过程进行了形式化建模。研究者识别出了导致关联推断攻击的根本原因,并提出了针对性的协议改进方案。这些设计建议已经被 Wi-Fi Alliance 和 Bluetooth SIG 采纳。这标志着学术研究直接推动了全球无线通信标准的演进,提升了数十亿移动设备在面对重放攻击时的隐私抗性。 [link]

Cross-Corpus Evaluation of Generalizable Vulnerability Detection in IoT Firmware

Sadib Hassan Rumman, Md. Shariful Islam, et al. · 2026/8/13

现有的 IoT 固件漏洞数据集大多包含大量合成代码,缺乏跨领域的泛化能力。IoTVulBench 是一个经过人工验证的高质量基准。它涵盖了从 GitHub 抓取的真实漏洞,并进行了严格的防污染处理。实验证明,领域匹配的训练数据比单纯增加模型规模更重要。通过课程学习和集成策略,模型在极低误报率下捕捉到了绝大部分漏洞。这为工业界的固件安全审计提供了性能更强的配置方案。 [link]

An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs

Md. Nahid Hasan, Mohammad Arif Hossain · 2026/8/13

下载开源大模型就像拆盲盒,没人能保证里面没藏后门。本文提出了一种名为 self-feeding 的黑箱检测法。该方法将模型的输出作为下一次的输入,诱导模型进入预设的训练分布。这种类似反馈循环的过程能让隐藏的 Trigger 显形。在 3B 到 15B 规模的模型上,该方法达到了 92% 的精确度。这种低成本检测方案是用户验证第三方模型安全的有力武器,无需接触训练数据即可执行。 [link]

A Runtime Decentralized Attestation and Coordinated Repair Framework for Securing Automotive ECUs

Josh Dafoe, Niusen Chen, et al. · 2026/8/13

仅仅检测出车载 ECU 被注入恶意软件是远远不够的。DACER 框架首次将运行时证明与协调修复结合在一起。它利用 ARM TrustZone 提供的隔离能力,实现了固件的回滚与安全启动。这种设计兼顾了局部修复的灵活性与全局车辆上下文的安全性。实验结果显示,在真实的硬件平台上,DACER 产生的系统开销极低。它完全符合汽车电子的实时性要求,为智能汽车提供了闭环的自愈安全架构。 [link]

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

Junliang Liu, Ruoyu Li, et al. · 2026/8/13

当 Agent 具备调用外部技能的能力时,攻击者可以通过恶意描述来误导决策。CDH 攻击利用自然语言在语义上的模糊性,在任务规划阶段制造出虚假的依赖关系。这会导致 Agent 在完成任务的过程中产生不必要的资源消耗和时间延迟。实验显示在 DeepSeek 等后端上,这种劫持的成功率极高。即使任务最终成功完成,用户的 Token 成本也已经攀升。这提醒开发者必须加强对工具调用轨迹的监控。 [link]

AI 论文

Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet

Eliseo Curcio · 2026/8/13

强化学习能降低数据中心能耗吗?研究者利用 PPO 控制器对 72 B 规模大模型训练过程中的 GPU 功率进行动态调节。该系统能实时感知计算负载,在保证吞吐量的同时将功率违规率降低了 89.8 %。实验在单机环境取得了成功,还在 16 GPU 集群上验证了超额订阅硬件算力的可行性。这是大模型工程向绿色计算迈出的关键一步。 [link]

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

Dongyang Ao, Kaixiang Fang, et al. · 2026/8/13

腾讯在工业推荐系统中部署了 RecSys Factory 平台。它解决了 Agent 在生产环境中的确定性与效率难题。通过将决策点与流水线解构,该系统能自动处理特征提取与 A/B 测试,且不占用额外的空闲算力。长达 78 天的实测结果显示平台成功率接近八成。这种将 Agent 深度嵌入业务流程的范式,为推荐系统自动化提供了成熟的工程样板。 [link]

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

Ofir Ben Shoham, Shrutendra Harsola, et al. · 2026/8/13

生成专业的财务建议需要平衡数值推理与严谨的商业判断。研究者采用 GRPO 算法微调开源模型,并引入因果推理中的 CATE 估计器进行独立审计。在真实业务记录测试中,该模型带来的利润提升是主流商业模型的两倍,且回撤风险更低。这项研究证明了强化学习结合领域专家规则,能产生比通用大模型更具实战价值的决策建议。 [link]

AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search

Weicheng Ye, Youran Sun, et al. · 2026/8/13

寻找量化交易因子不再只是人类专家的工作。 AgonAlpha 架构实现了从假设提出、代码执行到风险审查的全流程自动化。它引入了具备否决权的对抗性审阅机制,确保每个发现的 Alpha 因子都经过严格重测。系统在真实交易平台上挖掘出了多组高质量因子,其夏普比率表现优异。这种闭环的自动研究系统正在重塑定量投资的研究边界。 [link]

LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

Xiaojun Wu, Cehao Yang, et al. · 2026/8/13

在硬件资源有限的情况下如何高效训练千亿参数模型? LazyTrain 框架将显存分配与通信重叠转化为混合整数调度问题。通过引入混合 8 bit 算子,它显著降低了显存占用并提升了训练吞吐量。在 H800 环境下,该方案将训练速度提升了 24 %。对于追求极速迭代的算法工程师而言,这是一套针对显存优化的核心利器,能显著提升单卡训练上限。 [link]

LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

Yirui Liu, Ruoling Qi, et al. · 2026/8/13

混合架构模型在推理加速上面临缓存碎片化难题。 LinearKV 框架提出了一种无需训练的 PIC 方案。它利用解耦初始化技术,仅需一个缓存状态即可恢复大部分生成质量。在 32 K 长文本测试中,该方案将首 Token 延迟降低了约一半。它在 Mamba-2 等新兴架构上表现稳健,极大提升了混合架构模型的在线服务效率,对优化长文本推理成本具有重要的工程参考意义。 [link]

InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

Yuan Gao (Wanxiang), Zeren Yang (Wanxiang), et al. · 2026/8/13

基础设施自动化管理是 Agent 的终极考验。 InfraBench 涵盖了从系统底座到业务生命周期的真实运维任务。该基准详细展示了模型在持久化变更上的短板,并强调了安全副作用评估的重要性。它为开发更稳健、具备工业可用性的 IT 运维机器人提供了明确的方向和评估尺度,直接助力于构建高可靠性的自主维护系统。 [link]

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

Kelvin P. Idanwekhai, Enes Kelestemur, et al. · 2026/8/13

药物研发中的先导化合物优化充满挑战。 SABLE 框架利用自然语言编排,将合成约束、药代动力学预测与贝叶斯优化无缝衔接。该框架如同一个数字孪生实验室,能自动在广阔的化学空间中筛选可合成的潜力分子。其模块化设计允许科研人员随时更换底层评分工具。对于需要平衡多维指标的生物制药工程师,这是一个极具扩展性的决策支持系统。 [link]

Learning from Online User Feedback for Shopping Agents

Haobo Zhang, Kelong Mao, et al. · 2026/8/13

购物 Agent 如何从用户的吐槽中自动进化? LOFA 框架直接从真实的电商交互日志中提取学习信号。它将可验证的购买结果与反馈感知的策略蒸馏相结合,无需人工标注即可从海量在线数据中学习用户偏好。实验证明这种从真实反馈中闭环迭代的方法显著提升了推荐准确性。该研究为构建智能导购提供了高效、低成本的技术路径。 [link]

Harnessing agent memory to build lifelong AI partners for materials scientists

Siyu Liu, Bo Hu, et al. · 2026/8/13

材料科学的经验往往碎片化地保存在实验笔记中。研究者提出了自进化内存框架,将科研经验转化为可检索的事实与技能。即便不更新模型参数,这套持久性记忆也能让 Agent 的任务成功率翻倍。它能在计算失败时自动触发防护栏,避免重复无效劳动。这种将科学知识资产化的工程思路,让 AI 真正成为了材料学家的长期科研合伙人。 [link]

BleepingComputer 新闻

"City-Forum" data-theft attacks target Salesforce, ServiceNow portals

Lawrence Abrams · 2026/8/13 7:07

一场持续的数据窃取活动正在使用自定义工具。该工具利用 Salesforce Experience Cloud 和 ServiceNow 客户门户,窃取向匿名用户暴露的数据。 [link]

WhatsApp rolls out new feature that flags potential scam messages

Sergiu Gatlan · 2026/8/13 19:50

WhatsApp 开始推出新的可选功能 Scam Alert。该功能使用本地机器学习模型。当诈骗者盯上用户时,它会向用户发出警报。 [link]

Who Vets AI’s Code? The Scale Challenge Facing Open Source Ingestion

Sponsored by ActiveState · 2026/8/13 22:00

AI 编程工具引入未经审核或幻觉产生的开源依赖项的速度非常快。传统的安全审查难以跟上其节奏。ActiveState 解释了为什么组织应该在软件包进入开发流水线之前,在选择阶段就进行治理。 [link]

White House taps security firms for offensive hack-back operations

Sergiu Gatlan · 2026/8/13 21:30

美国总统签署的一份白宫新备忘录指示 NCC 建立一个计划。该计划允许私营安全公司申请许可,对外国网络犯罪组织进行反向黑客攻击。 [link]

Trezor discloses data breach affecting nearly 14,000 customers

Sergiu Gatlan · 2026/8/13 23:13

硬件钱包制造商 Trezor 披露了一起影响近 14000 名客户的数据泄露事件。其运输供应商和物流合作伙伴 ShipMonk 遭到黑客攻击,导致了此次泄密。 [link]

Critical VMware vCenter RCE flaw exploited for reverse SSH access

Bill Toulas · 2026/8/14 0:40

VMware vCenter Syslog Server 中一个最近修复的关键漏洞 CVE-2026-59310 正在被利用。攻击者在活动中部署反向 SSH 工具,用于维持权限和远程访问。 [link]

Microsoft patches LegacyHive Windows zero-day vulnerability

Sergiu Gatlan · 2026/8/14 1:46

微软发布了安全补丁以修复名为 LegacyHive 的 Windows 0-day 漏洞。该漏洞在 2026 年 7 月的补丁星期二之后被披露。 [link]

AI 'watermark removers' flood the web. Almost none can prove they work.

Ax Sharma · 2026/8/14 1:33

在 Anthropic 开始对 Claude 生成的文本添加水印几天后,网络上出现了多种水印去除工具。其中包括一个拥有超过 4500 个 GitHub 星标的开源项目。由于 Anthropic 尚未发布检测器,这些工具声称能破解文本水印的说法无法验证。 [link]

Hackers breach govt webmail while running parallel crypto fraud

Bill Toulas · 2026/8/14 2:15

黑客组织 Jewelbug 一直在针对政府和军事机构开展间谍活动。他们同时还在从事加密货币欺诈。 [link]

Ukraine shuts down 94 fraudulent call centers, seize millions in cash

Bill Toulas · 2026/8/14 5:12

乌克兰当局关闭了全境 94 个欺诈呼叫中心。这些中心诱导人们参与投资骗局,或者试图获取银行账户的访问权限。 [link]

Akira hackers disable EDR with Safe Mode, steal data but fail to encrypt

Bill Toulas · 2026/8/14 4:47

Akira 勒索软件的一名附属成员禁用了受感染系统上的 EDR 解决方案。他通过将机器重启进入带网络连接的安全模式来实现这一目标。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/8/13 7:08 至 2026/8/14 7:09