网安 + AI 前沿日报

2026/4/16 · CyberRadar

网络安全论文

Parallax: Why AI Agents That Think Must Never Act

Joel Fokou · 2026/4/15

智能体权限失控已成为核心风险。Parallax 提出了一种颠覆性的架构方案。它强制执行认知与执行分离,让负责推理的模型无法直接操作环境。通过引入独立的多层验证器和可逆执行机制,它在恶意指令到达系统底层前就能将其拦截。实验显示该架构能屏蔽 98.9 % 的攻击。即使推理模型被彻底攻破,这道架构防线依然稳固。它为 AI 智能体进入生产环境提供了安全底座。 [link]

Beyond Static Sandboxing: Learned Capability Governance for Autonomous AI Agents

Bronislav Sidik, Lior Rokach · 2026/4/15

自动智能体往往默认拥有过高权限。Aethelgard 针对这一安全隐患构建了自适应治理框架。它利用 RL 学习策略,根据任务类型动态压缩工具集。框架包含能力治理器、学习策略和安全路由三层结构。它能自动识别任务所需的最小技能集,将能力溢出比例降低 15 倍。这种基于最小特权原则的防御手段,比传统的静态沙箱更灵活。它是构建可信自主智能体的工程实践指南。 [link]

SIR-Bench: Evaluating Investigation Depth in Security Incident Response Agents

Daniel Begimher, Cristian Leo, et al. · 2026/4/15

现有的安全智能体往往只是在复述告警,缺乏真正的取证能力。SIR-Bench 填补了这一评估空白。它包含 794 个测试用例,涵盖 129 种经过专家验证的真实事故模式。研究者开发了 Once Upon A Threat 框架来重放云端威胁,产生真实的遥测数据。通过考察分诊准确度、新证据发现和工具调用合理性,该基准能精准区分真正的调查和机械的告警。它为自动化安全运营的进化指明了方向。 [link]

TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs

Qingchao Shen, Zibo Xiao, et al. · 2026/4/15

聊天模板是 LLM 安全防御中常被忽视的隐蔽攻击面。TEMPLATEFUZZ 是一款精细化的模糊测试框架,专门通过变异聊天模板来触发越狱攻击。它设计了元素级变异规则,并结合主动学习策略来评估攻击效果。该工具在 12 个开源模型上实现了 98.2 % 的攻击成功率。即使是无法修改模板的闭源模型,也能通过特定的 Prompt Injection 达到 90 % 的成功率。它迫使开发者重新审视模型交互协议的安全。 [link]

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

Yulin Chen, Tri Cao, et al. · 2026/4/15

网络智能体容易受到网页中嵌入的恶意指令操控。WebAgentGuard 提出了一种双智能体防御模式。它让一个专门的防护模型与执行模型并行工作,实现检测逻辑与任务推理的解耦。研究团队利用 GPT-5 生成了包含 164 个主题的多模态数据集,并结合强化学习提升模型的辨别力。该方案在不增加延迟的前提下,显著增强了智能体对抗 Prompt Injection 的韧性。它是保障网页自动化任务安全的实用方案。 [link]

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

Justice Owusu Agyemang, Jerry John Kponyo, et al. · 2026/4/15

向云端发送 Prompt 时如何平衡隐私与功能?LLM-Redactor 对 8 种隐私保护技术进行了深度横向评测。研究涵盖了本地推理、占位符脱敏、语义改写等实用路径。通过对 1300 个真实样本的测试,发现组合方案能将隐私泄露率降至 0.6 %。项目开源了完整的检测插件和基准测试集,支持 OpenAI 兼容的所有 API。这为企业在合规前提下集成大模型提供了清晰的技术决策路线图。 [link]

COBALT-TLA: A Neuro-Symbolic Verification Loop for Cross-Chain Bridge Vulnerability Discovery

Dominik Blain · 2026/4/15

跨链桥的安全漏洞动辄造成数亿美元损失。COBALT-TLA 将 LLM 与 TLA+ 模型检查器结合,构建了神经符号验证闭环。它能自动生成形式化规格说明,并利用检查器的反馈不断迭代修正。该系统在两轮内就复现了著名的 Nomad 协议漏洞,甚至自主发现了一种前所未见的攻击路径。这种方法有效解决了 LLM 在复杂逻辑推理中的幻觉问题。它是区块链基础设施安全验证的重大工程突破。 [link]

VeriX-Anon: A Multi-Layered Framework for Mathematically Verifiable Outsourced Target-Driven Data Anonymization

Miit Daga, Swarna Priya Ramu · 2026/4/15

外包数据脱敏时,如何确信云服务商没有偷工减料?VeriX-Anon 建立了一套数学可验证的框架。它融合了 Merkle 树确定性验证、边界哨兵概率验证和可解释 AI 指纹对比。这套多层防御机制能捕捉 12 种攻击场景中的绝大部分作弊行为。在处理百万行数据时,客户端验证耗时不到一秒。它在保护数据隐私的同时,解决了外包计算中的信任难题。该框架为敏感数据的安全流动提供了闭环保障。 [link]

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, et al. · 2026/4/15

软件逻辑漏洞比内存安全漏洞更难修复,因为它们涉及复杂的语义理解。LogicEval 是首个专门针对真实世界逻辑漏洞的系统化修复评估框架。研究者构建了包含 86 个 CVE 漏洞的 LogicDS 数据集,并深度对比了传统方法与多种 LLM 的修复效果。实验揭示了当前模型在代码上下文丢失和补丁定位方面的短板。这项研究为开发更智能、更精准的自动化代码修复工具奠定了实验基础。 [link]

Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling

Zida Li, Jun Li, et al. · 2026/4/15

文本生成图像模型的后门攻击日益隐蔽,传统检测方法难以察觉。SET 框架从主动探测的角度出发,利用交叉注意力缩放响应差异进行检测。它发现良性输入与含后门输入在去噪步骤中表现出截然不同的响应模式。该方法无需模型训练数据或先验攻击知识,仅凭少量干净样本即可学习正常空间。它在隐蔽触发器场景下表现卓越,将检测准确率提升了 9.1 %。这是 T2I 模型安全部署的重要防御利器。 [link]

AI 论文

Toward Autonomous Long-Horizon Engineering for ML Research

Guoxin Chen, Jie Chen, et al. · 2026/4/15

长期机器学习研究工程极具挑战。 AiScientist 打破了这一僵局。它要求高效的局部推理,并能协调复杂的实验。该系统采用 File-as-Bus 架构。 Orchestrator 负责全局管理。各专业 Agent 围绕文件总线进行协作。它们直接在代码、分析和实验证据上协同工作。这种设计确立了持久化的状态管理。实验显示该系统在 PaperBench 评分中领先。它为自动化科研工程提供了可落地的系统范式。 [link]

AlphaEval: Evaluating Agents in Production

Pengrui Lu, Bingyu Xu, et al. · 2026/4/15

实验室里的 Agent 评估指标正脱离生产实际。 AlphaEval 填补了这一鸿沟。它从 7 家真实企业收集了 94 个生产任务。这些任务包含模糊约束和碎片化信息。评估框架融合了 LLM-as-a-Judge 和形式化验证。它揭示了商业模型在长程交付中的真实瓶颈。研究者还贡献了一套从业务需求到评测任务的自动转换方法。这套工具链让企业能快速构建垂直领域的可靠基准。它是迈向生产级 AI 代理的必要参考。 [link]

Policy-Invisible Violations in LLM-Based Agents

Jie Wu, Ming Gong · 2026/4/15

企业级 Agent 常在不知情中违反政策。幻影政策现象源于决策时关键事实被隐藏。 PhantomPolicy 针对这一安全盲点构建了包含 8 类违规场景的基准。它涵盖了业务数据中的隐形红线。为了解决该问题,研究者提出了 Sentinel 框架。该框架利用知识图谱进行反事实仿真。它将动作预演为图谱变更。通过验证结构不变量,系统能精准拦截违规指令。这种基于状态落地的强制执行机制显著优于传统检测手段。 [link]

Development, Evaluation, and Deployment of a Multi-Agent System for Thoracic Tumor Board

Tim Ellis-Caleo, Timothy Keyes, et al. · 2026/4/15

肿瘤多学科会诊急需精准的病例摘要。斯坦福团队成功部署了一套多 Agent 系统。该系统专为胸部肿瘤委员会设计。它能自动处理原始放射学和病理学数据。研究人员开发了多种图表摘要生成方法。他们利用医师标准和事实评分准则进行验证。模型表现通过了 LLM-as-a-Judge 策略的检验。目前该工具已整合进日常临床流程。它为 AI 赋能重症医疗决策提供了宝贵的工程实践经验。 [link]

LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks

Luyi Ma, Wanjia Sherry Zhang, et al. · 2026/4/15

广告冷启动中的用户反馈极其匮乏。 LLM-HYPER 创新性地将大模型用作超网络。它直接为 CTR 预估器生成参数。该框架利用多模态广告内容进行 Chain-of-Thought 推理。它检索相似的历史活动。系统能快速推断出特征权重。为了确保稳定性,研究者引入了归一化和校准技术。在线 A/B 测试显示该方法大幅缩短了冷启动周期。该系统已在美国顶尖电商平台上线。它证明了大模型生成参数在生产环境中的卓越效能。 [link]

GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses

Jimin Mun, Chani Jung, et al. · 2026/4/15

大模型应当赋能科研人员,而非简单替代。 GoodPoint 专注于生成建设性的论文反馈。它从 1.9 万篇 ICLR 论文中提取了真实评阅意见。研究者通过微调 Qwen3-8B 获得了强大的反馈生成能力。该模型在有效性和可操作性上表现出色。其反馈质量甚至超越了 Gemini-3-flash。专家人类研究验证了该系统的实用价值。它能生成更符合作者需求的针对性建议。这种人机协同模式为学术界提升研究质量提供了有力支撑。 [link]

MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents

Joongmin Shin, Chanjun Park, et al. · 2026/4/15

工业文档结构复杂且篇幅巨大。 MultiDocFusion 打造了一套多模态切片流水线。它利用视觉解析技术探测文档区域。通过 OCR 提取文本后,系统使用 DSHP-LLM 重构层级树。这种深度优先搜索的成组方式保留了文档的层级逻辑。实验表明该方法在工业基准上的检索精度提升了 15% 以上。它解决了 RAG 系统在处理长文档时的信息丢失痛点。该方案为企业级长文档问答系统树立了新的技术标杆。 [link]

Narrative-Driven Paper-to-Slide Generation via ArcDeck

Tarik Can Ozden, Sachidanand VS, et al. · 2026/4/15

手动将科研论文转化为幻灯片既费时又费力。 ArcDeck 提出了一个多 Agent 框架。它将生成过程视为结构化的叙事重构。系统先解析输入文档并构建话语树。这确保了核心逻辑被完整保留。专业 Agent 随后进行迭代微调。它们反复修正提纲并渲染最终视觉布局。在 ArcBench 基准测试中,该方法展现了卓越的叙事流畅度。它比传统的直接摘要法更懂论文逻辑。科研人员从此可以专注于内容讲解。 [link]

RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair

Jagadeesh Rachapudi, Pranav Singh, et al. · 2026/4/15

用户难以直接控制大模型已学习的隐私数据。 RePAIR 开启了交互式机器遗忘的新范式。它允许用户通过自然语言指令要求模型遗忘特定知识。该框架包含看门狗、外科医生和患者模型。核心技术 STAMP 利用伪逆矩阵操作激活值。这种无训练方法能将神经元激活导向拒绝子空间。它在移动端运行速度极快。该技术实现了极高的遗忘准确率。它让个人数据擦除在端侧大模型上变得触手及。 [link]

Coding-Free and Privacy-Preserving MCP Framework for Clinical Agentic Research Intelligence System

Taehun Kim, Hyeryun Park, et al. · 2026/4/15

临床研究往往受限于编程门槛和隐私合规。 CARIS 实现了全流程自动化的研究智能系统。它利用 MCP 协议整合多种模块化工具。临床医生通过自然语言即可策动整个流水线。系统涵盖了研究规划、队列构建和 IRB 文档生成。它通过迭代优化确保产出质量。在多个异构数据集上的验证显示其报告覆盖率极高。该系统无需医生编写代码。它在保护原始数据隐私的同时,加速了临床假设的验证过程。 [link]

BleepingComputer 新闻

Microsoft: April updates trigger BitLocker key prompts on some servers

Sergiu Gatlan · 2026/4/15 19:41

微软周二确认,部分 Windows Server 2025 设备在安装 2026 年 4 月的 KB5082063 安全更新后,会进入 BitLocker 恢复模式。 [link]

Microsoft fixes bug behind Windows Server 2025 automatic upgrades

Sergiu Gatlan · 2026/4/15 18:24

微软修复了一个已知漏洞。该漏洞曾导致运行 Windows Server 2019 和 2022 的系统意外升级至 Windows Server 2025。 [link]

CISA flags Windows Task Host vulnerability as exploited in attacks

Sergiu Gatlan · 2026/4/15 22:51

CISA 警告美国政府机构,应针对 Windows Task Host 提权漏洞保护其系统。攻击者利用该漏洞可以获取 SYSTEM 权限。 [link]

Rolling Networks: Securing the Transportation Sector

Sponsored by NMFTA · 2026/4/15 22:00

现代卡车是集传感器、联网功能和攻击面于一体的移动网络。这些特性带来了新的网络风险。NMFTA 网络安全会议召集行业领袖,共同应对交通领域的新兴威胁。 [link]

Microsoft pays $2.3M for cloud and AI flaws at Zero Day Quest

Sergiu Gatlan · 2026/4/16 0:20

微软在今年的 Zero Day Quest 黑客竞赛中收到了近 700 份提交,并向安全研究人员发放了 230 万美元奖金。 [link]

Signed software abused to deploy antivirus-killing scripts

Bill Toulas · 2026/4/16 1:59

一个带有数字签名的广告软件工具被滥用来部署 Payload。该程序以 SYSTEM 权限运行,并禁用了数千个终端的防病毒保护。受影响的机构涵盖教育、公用事业、政府和医疗行业。 [link]

WordPress plugin suite hacked to push malware to thousands of sites

Bill Toulas · 2026/4/16 4:33

EssentialPlugin 软件包中超过 30 个 WordPress 插件被植入恶意代码。这些代码允许攻击者非法访问运行此类插件的网站。 [link]

New AgingFly malware used in attacks on Ukraine govt, hospitals

Bill Toulas · 2026/4/16 5:57

在针对乌克兰当地政府和医院的攻击中,发现了一个名为 AgingFly 的新恶意软件家族。该程序能够从 Chromium 浏览器和 WhatsApp 中窃取身份验证数据。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/4/15 7:08 至 2026/4/16 7:07