SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants
智能体自主执行任务极具潜力,但推理失败导致的非预期操作风险巨大。SafeClaw-R 框架将安全作为系统级约束。它在执行图上对动作进行实时拦截与审计,并自动为不安全技能匹配加固后的替代方案。实验表明该框架在工作流场景中准确率高达 95.2 %。它为 Agent 的实际部署提供了可靠的运行保护。 [link]
2026/4/2 · CyberRadar
智能体自主执行任务极具潜力,但推理失败导致的非预期操作风险巨大。SafeClaw-R 框架将安全作为系统级约束。它在执行图上对动作进行实时拦截与审计,并自动为不安全技能匹配加固后的替代方案。实验表明该框架在工作流场景中准确率高达 95.2 %。它为 Agent 的实际部署提供了可靠的运行保护。 [link]
微调 API 可能成为防御系统的后门。Trojan-Speak 利用课程学习和 GRPO 强化学习,教会模型一套能绕过 Anthropic 安全分类器的隐写协议。该攻击在 14 B 以上参数的模型中实现了 99 % 以上的逃逸率。这种攻击对通用推理能力几乎没有损耗。它提醒我们单纯依赖模型层面的内容审查已难挡有目的的对抗性微调。 [link]
本地 SLM 能否同时解决隐私泄露与高昂 Token 成本?这篇论文提出了隐私卫士框架。它在本地对 Prompt 进行摘要提取与任务分解,将敏感请求重定向至受信任模型。这种双重机制在实现零泄露的同时,将云端 Token 开销降低了 45 %。这种将隐私管理与上下文压缩结合的思路,为企业大规模应用 LLM 扫清了工程障碍。 [link]
政务机器人常面临多轮对话诱导攻击。CivicShield 借鉴纵深防御思想,构建了包含语义防火墙和行为异常检测在内的七层防御体系。它不仅通过零信任架构管控权限,还引入人类协作机制处理高风险指令。实测显示其对多轮攻击的防御成功率极高。该框架有效填补了政府级 AI 应用在合规性与安全性之间的空白。 [link]
加密流量分类常因加密噪声导致特征模糊。TrafficMoE 引入稀疏 MoE 架构,对报文首部与负载进行解耦建模。它采用不确定性过滤机制抑制高方差噪声,并根据流量上下文动态分配路由权重。在六个公开数据集上的实验结果刷新了 SOTA 记录。这种面向异构流量的动态建模范式,为网络安全分析提供了更加精细化的工具。 [link]
用大模型评价大模型已成主流,但法官本身的安全性却被长期忽视。这份系统性综述深度剖析了 LLM-as-a-Judge 的安全边界。文章归纳了针对评价流程的对抗性操控手段,以及法官模型被利用作为攻击工具的可能性。它梳理了现有的防御加固技术,并为构建下一代高可信评估管线指明了研究方向。这是安全从业者不可错过的知识图谱。 [link]
模型供应链正面临投毒和非法篡改的严峻挑战。本文针对 LLM 训练与发布流程,提出了一套可验证的声明门禁机制。它通过密码学手段将模型权重、数据集和环境配置进行强绑定。在模型进入部署环境前,系统会自动校验其溯源证据并执行静态扫描。这套方案为大模型从开发到交付的闭环安全提供了坚实的工程支点。 [link]
传统的联邦学习后门攻击往往依赖明显的合成贴纸,在现实中极易被发现。SABLE 提出了一种语义感知的新型攻击策略。攻击者通过改变墨镜等自然属性来触发后门,并结合聚合感知优化技术,让恶意更新在统计特征上与正常更新极度接近。实验验证该方法能突破多种防御规则。这揭示了分布式学习环境下面对隐蔽攻击时的脆弱本质。 [link]
小模型在边缘设备应用广泛,但极易受到恶意指令攻击。GUARD-SLM 发现不同类型的输入在模型内部表示空间中具有独特分布特征。它利用 Token 激活模式在推理阶段实时过滤非法 Prompt,且不需要高昂的计算开销。这种轻量级防御方案在保持模型性能的同时,显著增强了小模型在异构攻击下的鲁棒性,为终端 AI 普及安全底座。 [link]
现有的 AI 基准测试大多关注红队攻击。SOC-bench 填补了蓝队能力评估的空白。它专注于衡量多智能体系统在处理大规模勒索软件入侵等实战场景中的协同防御表现。通过五个核心响应任务,该框架量化了 AI 智能体在安全运营中心自动化任务中的成熟度。它为企业评估 AI 辅助防御工具的实际产出提供了客观标准。 [link]
AI 研发正在进入自动驾驶时代。ASI Evolve 构建了学习、设计、实验到分析的闭环。它在神经架构搜索中发现了 105 个领先的线性注意力架构。在预训练数据清洗上,它让 MMLU 分数提升了 18 点以上。它在强化学习算法设计中同样超越了 GRPO。这种 AI 发现 AI 的范式正在向数学和生物领域扩展。它证明了闭环自主研究在真实 AI 工业流程中完全可行。 [link]
自主代理总是从零开始解决重复任务,缺乏持久的程序记忆。APEX EM 改变了这一点。它采用非参数化在线学习框架,无需修改模型权重。系统能够存储并检索结构化的执行轨迹。它在 KGQAGen 10k 任务中将准确率从 41.3% 提升至 89.6%。面对没有词汇重叠但结构相似的任务,该框架依然能实现跨领域迁移。这种即插即用的记忆能力为生产级代理系统提供了坚实的技术支撑。 [link]
想要在不损失性能的前提下压缩 9B 大模型吗?PolarQuant 提供了几乎无损的量化方案。它通过 Hadamard 旋转将权重分布转换为高斯随机变量。这种方法完全不需要校准数据,且在 Qwen 3.5 9B 上实现了接近 FP 16 的困惑度表现。它是独立的压缩工具,也可作为 INT 4 量化的预处理步骤。43.1 tokens/s 的吞吐量配合极低的显存占用,让大模型在终端设备上高效运行成为现实。 [link]
长文档问答往往面临高延迟和推理不可靠的问题。LiteCoST 框架让 3B 级别的 SLM 具备了挑战 GPT 4o 的实力。它引入结构化思维链模板,引导模型生成可审计的中间步骤。通过 GRPO 强化学习,模型在格式质量和过程一致性上得到了深度对齐。相比 671B 的 DeepSeek R1,它的推理延迟降低了 2 到 4 倍。这种轻量化、高精度的方案为企业级长文档分析开辟了新路径。 [link]
持续预训练中的数据混合比例一直是昂贵的调试难题。OptiMer 提出了数据配比与训练解耦的新方案。研究者为每个数据集训练独立的 CPT 模型,提取表示参数偏移的分布向量。利用贝叶斯优化,系统在训练后搜索最优合成权重。实验证明该方法在 Gemma 3 27B 上表现优异,搜索成本降低了 15 到 35 倍。它将原本需要在训练前决定的困难选择转变为灵活的后验优化过程。 [link]
传统的视觉世界模型往往忽略了动作对状态转换的显式约束。WAM 引入了动作正则化机制,让模型同时学习未来图像预测与逆动力学。在 CALVIN 机器人操控基准测试中,这种方法极大地增强了表征的语义质量。WAM 将行为克隆的平均成功率从 59.4% 提升至 71.2%。配合 PPO 微调后,其成功率高达 92.8%,且训练步数减少了 8.7 倍。它为具身智能的高效学习提供了强有力的动力学基础。 [link]
工业级内容生态需要极致的成本控制与对抗防御能力。玄武 VL 2B 仅用 20 亿参数就实现了卓越的视觉感知。它采用 InternViT 300M 配合 Qwen 3 1.7B 的精简架构。在对抗性 OCR 场景中,其召回率达到 82.82%,显著超越了 Gemini 2.5 Pro。研究团队通过三阶段渐进式训练解决了长尾噪声和灾难性遗忘问题。它是通用多模态模型向垂直行业落地的优秀工程典范。它在性能与成本之间找到了绝佳平衡。 [link]
现有 AI 代理在处理紧急任务时往往缺乏时间观念和环境感知。TCA 三元认知架构将物理世界的连续时间动力学引入推理过程。它定义了认知摩擦概念,将决策建模为受路径约束的随机控制问题。代理不再盲目等待停止符,而是根据风险和时间成本实时评估信息价值。在急诊医学模拟中,该架构显著缩短了行动响应时间。它让代理在保持诊断精度的同时大幅提升了处理高危任务的效率。 [link]
生产环境要求模型有能力,同时也要求它足够可靠。这项研究引入了首个长程代理可靠性科学框架。它通过 RDC 和 GDS 等四项核心指标量化模型在长时间跨度下的表现。实验发现前沿模型的崩溃率竟然高达 19%,因为复杂的策略容易陷入死循环。可靠性排名与能力排名在长任务中经常发生大幅倒置。该工作为 AI 代理从实验室原型走向真实生产线提供了必备的评估准则和诊断工具。 [link]
多跳问答是 RAG 系统公认的死穴。PAR2 RAG 通过两阶段框架解决了这一挑战。它先进行广度优先锚定以构建高召回率的证据边界,再通过深度优先循环进行精细化推理。这种设计将覆盖度与承诺解耦,有效防止了检索路径过早锁定导致的下游错误。在多个基准测试中,其准确率比 IRCoT 高出 23.5%。它为处理复杂推理链条提供了更稳定且可控的检索范式,具备极高的工业应用潜力。 [link]
Google 正在美国推出一项新功能。该功能允许用户更改其 @gmail 地址或创建新的别名。 [link]
Proton 发布了名为 Meet 的新视频会议服务。它被定位为注重隐私的替代方案,旨在竞争 Google Meet、Zoom 以及 Microsoft Teams 等主流服务。 [link]
GIGABYTE Control Center 存在任意文件写入漏洞。远程且未经身份验证的攻击者可能利用该漏洞访问受影响主机上的文件。 [link]
Anthropic 表示意外泄露了 Claude Code 的源代码。该项目本应闭源,但公司称没有客户数据或凭据因此暴露。 [link]
Microsoft 发布了紧急更新以修复 2026 年 3 月的 KB5079391 非安全预览更新。该更新此前因安装问题在周末被撤回。 [link]
Google 宣布基于 AI 的 Google Drive 勒索软件检测功能已正式商用。目前该功能已为所有付费用户默认开启。 [link]
Google 修复了自今年年初以来被用于 zero-day 攻击的第四个 Chrome 漏洞。 [link]
美国 FBI 警告民众不要使用外国开发的移动应用程序。特别是由中国开发商创建的应用。 [link]
现代入侵越来越多地通过有效凭据和常规访问实现。Blackpoint Cyber 的威胁报告展示了 VPN 滥用、RMM 工具以及社交工程如何驱动大多数事件。 [link]
Google Play 发现名为 NoVoice 的新 Android 恶意软件。该软件隐藏在 50 多个应用中,下载次数至少达到 230 万次。 [link]
名为 EvilTokens 的新恶意工具包集成了设备代码网络钓鱼功能。攻击者可借此劫持 Microsoft 账户并实施企业电子邮件攻击。 [link]
Apple 为更多运行 iOS 18 的 iPhone 提供安全更新。这些更新旨在抵御正在被积极利用的 DarkSword 漏洞利用工具包。 [link]
黑客在攻击中利用 TrueConf 会议服务器的 zero-day 漏洞。攻击者可以在所有连接的终端上执行任意文件。 [link]