网安 + AI 前沿日报

2026/4/23 · CyberRadar

网络安全论文

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery

Abhinav Agarwal · 2026/4/22

大模型辅助代码审计总是产生大量误报,让开发者头疼不已。这篇文章提出了 Refute-or-Promote 框架,通过引入多模型对抗审计与强制性经验测试过滤噪音。研究团队利用该工具在安全库、编译器和 C++ 标准中挖掘出了 4 个 CVE 以及多个标准错误。它不靠模型自主,转而依靠严谨的外部约束结构,真正发现了高价值缺陷。 [link]

Temporal UI State Inconsistency in Desktop GUI Agents: Formalizing and Defending Against TOCTOU Attacks on Computer-Use Agents

Wenpeng Xu · 2026/4/22

像 Anthropic Computer Use 这样的 GUI 代理通过截图加点击的循环操作电脑,但这其中存在严重的观测与动作时间差。研究者发现了名为 TOCTOU 的新漏洞,攻击者可以在截图完成到动作触发的 6 秒窗口内篡改 UI。通过窗口焦点操纵等手段,攻击者能实现 100 % 的动作重定向。文章提出的 PUSV 验证机制为这类新兴系统的实时防御提供了三层防护。 [link]

From Craft to Kernel: A Governance-First Execution Architecture and Semantic ISA for Agentic Computers

Xiangyu Wen, Yuang Zhao, et al. · 2026/4/22

现在的 AI Agent 往往只靠大模型驱动,缺乏确定性的安全约束,导致其在生产环境中异常脆弱。Arbiter-K 框架将底层模型视为概率处理单元,外层包裹一个确定性的神经符号内核。它通过语义指令集架构将概率消息转化为离散指令,实现了精细的污点追踪与指令拦截。在 OpenClaw 等平台上的测试显示,该架构能大幅提升恶意指令拦截率。 [link]

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

Alankrit Chona, Igor Kozlov, et al. · 2026/4/22

尽管 LLM 在现有的安全考试中表现优异,但在真实的威胁狩猎任务中表现如何?这篇论文推出了 Cyber Defense Benchmark,将 106 种真实的攻击过程封装进强化学习环境。实验发现,即便最强的模型也无法独立完成威胁发现任务,其平均召回率极低。该研究为 SOC 自动化部署泼了一盆冷水,明确了当前模型在处理原始日志时的巨大局限。 [link]

An AI Agent Execution Environment to Safeguard User Data

Robert Stanley, Avi Verma, et al. · 2026/4/22

AI 助手需要访问个人私密数据,但这可能导致严重的隐私泄露。GAAP 执行环境为 Agent 提供了数据机密性保证。它通过信息流控制技术,在不信任 Agent 和模型供应商的前提下,严格执行用户的权限规范。即使 Agent 受到 Prompt Injection 攻击,GAAP 也能通过跨任务的数据追踪确保私密信息不被导出。该系统为个人 AI 助理的大规模落地扫清了安全障碍。 [link]

Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis

Yongchao Wang, Zhiqiu Huang · 2026/4/22

传统的深度学习漏洞检测模型在处理去重后的真实代码时,性能往往会出现断崖式下跌。Phoenix 框架指出安全属性是相对于业务合同而言的,而非代码本身的静态属性。它通过多智能体框架合成业务规范,并利用这些规范进行合规性检查。在 48 倍于基座模型规模的情况下,该方案依然在检测精度上实现了反超,展示了逻辑推理在代码安全中的威力。 [link]

Owner-Harm: A Missing Threat Model for AI Agent Safety

Dongcheng Zhang, Yiqing Jiang · 2026/4/22

现有的 AI 安全基准大多关注通用犯罪,却忽视了 Agent 伤害其部署者这一极具商业影响的威胁。研究者提出了 Owner-Harm 威胁模型,涵盖凭据窃取、敏感信息泄露等八大类别。实验表明,现有的防护系统在面对针对部署者的指令注入时防御率极低。文章引入的符号语义防御框架能有效识别目标与动作的对齐性,为企业部署安全 Agent 提供了重要参考。 [link]

TrEEStealer: Stealing Decision Trees via Enclave Side Channels

Jonas Sander, Anja Rabich, et al. · 2026/4/22

决策树算法因其高效性被广泛用于金融和安全领域, TEE 硬件本应保护这些模型不被窃取。但 TrEEStealer 攻击揭示了 TEE 环境中的侧信道风险。它通过控制流信息追踪,能高效且高精度地提取受保护的模型权重。研究人员在 OpenCV 等流行库中发现了相关漏洞,证明了单纯依赖硬件隔离无法阻挡精密的微架构攻击。 [link]

EvoPatch-IoT: Evolution-Aware Cross-Architecture Vulnerability Retrieval and Patch-State Profiling for BusyBox-Based IoT Firmware

Yinhao Xiao, Huixi Li, et al. · 2026/4/22

BusyBox 广泛存在于各类 IoT 设备固件中,但跨架构的补丁比对一直是个工程难题。EvoPatch-IoT 利用匿名指令特征、图形统计和几何先验信息,实现了无需符号表的跨架构漏洞检索。它能精准定位潜在的易受攻击函数,将人工审计空间压缩了 98 % 以上。这套进化感知的二进制检索方案为大规模 IoT 固件安全审计提供了实用的工程底座。 [link]

Malicious ML Model Detection by Learning Dynamic Behaviors

Sarang Nambiar, Dhruv Pradhan, et al. · 2026/4/22

开发者经常从 Hugging Face 下载预训练模型,但 Pickle 等模型格式可能携带恶意代码。DynaHug 改变了传统的静态规则检测思路,转而通过动态分析学习正常模型的运行时行为。它利用 OCSVM 分类器监控异常系统调用,对恶意模型的检测效果比现有基准提升了 44 %。该方案能有效阻断针对模型供应链的任意代码执行攻击,守护用户的本地计算环境。 [link]

AI 论文

Micro Language Models Enable Instant Responses

Wen Cheng, Tuochao Chen, et al. · 2026/4/22

智能手表与眼镜受制于算力与功耗,难以运行常规大模型。本文推出参数量仅 8M 到 30M 的微型语言模型。它在云端模型加载时先行生成前 4 到 8 个单词,有效掩盖网络延迟。研究者设计了协作生成框架,实现端侧与云端的无缝衔接。实验证明其推理速度极快,在资源受限设备上实现了即时响应。这一突破让低功耗可穿戴设备的实时 AI 助手成为可能。 [link]

Are Large Language Models Economically Viable for Industry Deployment?

Abdullah Mohammad, Sushant Kumar Ray, et al. · 2026/4/22

企业级部署大模型必须权衡经济成本与硬件效率。本文推出专注于工业落地的评测框架 EDGE-EVAL。它在老旧的 Tesla T4 GPU 上评估模型全生命周期表现。研究引入了投资回报盈亏平衡点与每瓦特智能度等五个核心指标。测试显示 2B 以下模型在盈亏平衡速度上表现更优。该研究填补了模型评估与真实商业落地之间的鸿沟,为企业选型提供了数据支撑。 [link]

Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language Models

Lin Yao · 2026/4/22

Masked Diffusion 模型生成出错时,传统的直接覆盖策略往往导致错误堆叠。本文提出 Token-to-Mask 重掩码方案。它将疑似错误的 token 重置回 mask 状态,由模型根据上下文重新预测。该方法无需额外训练且不增加参数,完美适配推理阶段。在 CMATH 等多个基准测试中,它成功修复了大量推理过程正确但末尾结果杂乱的错误。这是提升扩散语言模型精确性的实用工具。 [link]

AutomationBench

Daniel Shepard, Robin Salimans · 2026/4/22

现有的软件自动化基准测试难以模拟复杂的企业工作流。AutomationBench 针对跨应用协调与 API 自动发现能力进行评估。它提取自真实业务模式,复现了销售与人力资源等六大领域的复杂任务。智能体必须自主发现 REST API 终点并遵循多层业务规则。目前顶级模型得分仍不足 10%。这一基准为智能体在真实办公环境中的落地指明了技术挑战。 [link]

Mango: Multi-Agent Web Navigation via Global-View Optimization

Weixi Tong, Yifeng Di, et al. · 2026/4/22

智能体在导航具有复杂层级结构的网站时,常陷入路径陷阱或无效分支。Mango 利用全局视图优化策略,动态确定最佳起始 URL。通过将路径选择建模为多臂老虎机问题,并结合 Thompson Sampling 分配搜索预算。它还引入情节记忆组件,让智能体从失败尝试中学习。在 WebVoyager 任务中,其成功率显著超越基准。该方案解决了深度网页结构下的高效探索难题。 [link]

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

Hanjun Cho, Jay-Yoon Lee · 2026/4/22

金融报告与法律条文存在大量冗余信息,这导致传统 RAG 系统评估失真。RARE 框架将文档分解为原子事实,实现精确的冗余追踪。研究者引入 CRRF 机制提升了合成数据的质量。在实际测试中,高性能检索器在复杂语料下的表现大幅下降。这一发现揭示了现有评估体系在处理高相似度语料时的局限性。RARE 为构建实用的领域级检索系统提供了科学标尺。 [link]

How Adversarial Environments Mislead Agentic AI?

Zhonghao Zhan, Huichi Zhou, et al. · 2026/4/22

集成工具的智能体过度信任外部反馈,容易成为受攻击的新目标。本文揭示了这种信任鸿沟,并定义了环境注入攻击模式。攻击者通过污染搜索结果或伪造引用网络来欺骗智能体,诱导其产生错误信念或陷入死循环。研究者开发了 POTEMKIN 测试工具,对多个顶尖智能体进行了安全性审计。实验显示,抵御逻辑漂移的智能体往往更容易在导航结构上失守。这为智能体安全防御提供了关键依据。 [link]

Two-dimensional early exit optimisation of LLM inference

Jan H\r{u}la, David Adamczyk, et al. · 2026/4/22

提升推理效率通常只关注层级退出。本文提出双维度早期退出策略,协调层级与句子维度的计算分配。在处理分类任务时,模型按句子增量处理并逐步激活深层网络。这种方案实现了乘法级别的算力节省,性能优于单一维度的优化。在 Llama 3.1 等多个主流模型上,它实现了高达 2.3 倍的加速。该方法具有通用性,且能与量化或剪枝等技术共存。 [link]

ClawNet: Human-Symbiotic Agent Network for Cross-User Autonomous Cooperation

Zhiqin Yang, Zhenyuan Zhang, et al. · 2026/4/22

现有智能体多为单用户服务,缺乏处理复杂组织关系的协作机制。ClawNet 提出了人机共生智能体范式,将人类协作关系数字化。它通过层级身份架构分离全局知识与外部通信,确保隐私安全。系统内置身份绑定与动作级问责机制,实现跨用户协作的全程可审计。这不再是单纯提升模型能力,而是为智能体融入社会化工作流构建底层治理架构。 [link]

A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression

Jincheng Ren, Siwei Wu, et al. · 2026/4/22

在长程终端任务中,冗余的环境反馈会导致 token 成本呈二次方增长。TACO 框架实现了自动化的观测上下文压缩。它从交互轨迹中自主演化压缩规则,无需固定提示词。实验表明,该方法在保持推理性能的同时,降低了约 10% 的消耗。在多个基准测试中,它帮助智能体在相同预算下实现了更高成功率。这一优化极大提升了终端操作类智能体的实用价值。 [link]

BleepingComputer 新闻

Microsoft releases emergency patches for critical ASP.NET flaw

Sergiu Gatlan · 2026/4/22 16:08

微软发布带外安全更新,用于修复 ASP.NET Core 中的关键提权漏洞。 [link]

Over 1,300 Microsoft SharePoint servers vulnerable to spoofing attacks

Sergiu Gatlan · 2026/4/22 14:53

超过 1300 台暴露在联网环境下的 Microsoft SharePoint 服务器仍未修复欺骗漏洞。该漏洞曾作为零日漏洞被利用,目前在攻击活动中仍被滥用。 [link]

New GoGra malware for Linux uses Microsoft Graph API for comms

Bill Toulas · 2026/4/22 18:00

GoGra 后门程序的 Linux 变体利用微软官方基础设施进行通信。它依靠 Outlook 收件箱实现隐蔽的 payload 投递。 [link]

Microsoft traces Universal Print issues to Graph API code change

Sergiu Gatlan · 2026/4/22 18:15

微软表示 Universal Print 共享问题由 Microsoft Graph API 的代码更改导致。该问题会阻止用户创建部分打印机共享。 [link]

New npm supply-chain attack self-spreads to steal auth tokens

Bill Toulas · 2026/4/22 20:57

一种针对 npm 生态系统的新型供应链攻击正在窃取开发者凭据。该攻击尝试通过被入侵账户发布的软件包进行自我传播。 [link]

Microsoft Teams to get efficiency mode on PCs with limited resources

Sergiu Gatlan · 2026/4/22 20:24

微软正准备为资源受限的电脑推出 Microsoft Teams 效率模式。此模式适用于 CPU 和内存有限的系统,旨在提高应用响应速度。 [link]

Inside Caller-as-a-Service Fraud: The Scam Economy Has a Hiring Process

Sponsored by Flare · 2026/4/22 22:01

欺诈操作现在的运行模式类似呼叫中心,包含招聘、培训和绩效跟踪流程。Flare 揭示了网络罪犯如何像管理专业销售团队一样管理 Caller-as-a-Service 业务。 [link]

Spain dismantles major $4.7M manga piracy platform, arrests four

Bill Toulas · 2026/4/22 23:06

西班牙警方拆毁了自 2014 年起运营的大型西班牙语漫画盗版平台。该平台拥有全球数百万月活跃用户。 [link]

Kyber ransomware gang toys with post-quantum encryption on Windows

Bill Toulas · 2026/4/23 2:52

新的 Kyber 勒索软件团伙正针对 Windows 系统和 VMware ESXi 端点。其变体在近期攻击中实现了 Kyber1024 后量子加密。 [link]

New Mirai campaign exploits RCE flaw in EoL D-Link routers

Bill Toulas · 2026/4/23 4:04

新的 Mirai 攻击活动正在利用已停止维护的 D-Link 路由器中的 RCE 漏洞。该漏洞编号为 CVE-2025-29635,用于将设备纳入僵尸网络。 [link]

Apple fixes iOS bug that retained deleted notification data

Lawrence Abrams · 2026/4/23 4:58

苹果发布针对 iPhone 和 iPad 的带外安全更新,修复了 Notification Services 的漏洞。该漏洞可能导致标记为删除的通知数据仍存储在设备上。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/4/22 7:02 至 2026/4/23 7:10