网安 + AI 前沿日报

2026/2/14 · CyberRadar

网络安全论文

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

Zhenhua Zou, Sheng Guo, et al. · 2026/2/12

手机 AI Agent 正在改变交互方式,但屏幕截图式的架构存在巨大安全隐患。研究者深度剖析了豆包等主流助手,发现了伪造应用身份和绕过权限等严重漏洞。他们为此设计了 Aura 系统架构,用结构化的原生交互模型替代脆弱的 GUI 抓取。通过全局 Agent 注册表和语义防火墙,系统将任务成功率提升至 94.3 %。这种从底层操作系统重构安全防线的思路,为自主 Agent 大规模落地扫清了障碍。 [link]

Security Assessment of Intel TDX with support for Live Migration

Kirk Swidowski, Daniel Moghimi, et al. · 2026/2/13

机密计算是数据安全的最后一道防线。谷歌与英特尔合作,对支持热迁移的 TDX 模块进行了深度审计。这次研究通过 Gemini 辅助分析并开发了专门的测试工具包。团队在 1.5 版本源码中挖掘出多个高危漏洞,恶意虚拟机管理程序能完全掌控受保护的域。研究结果揭示了复杂硬件特性引入的攻击面,强调了纵深防御在可信执行环境中的重要性。这些发现已推动芯片巨头进行安全加固。 [link]

Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache

Ye Yu, Yifan Zhou, et al. · 2026/2/13

全同态加密让大模型隐私推理成为可能,但自回归生成的延迟通常令人难以忍受。Cachemir 框架首次将 KV Cache 引入全同态加密推理流程,有效打破了性能瓶颈。它通过创新的加密数据打包算法和优化的算子放置策略,将推理速度提升了数十倍。在 GPU 加持下,为 Llama-3-8B 生成单个 token 仅需不到 100 秒。这项工作让隐私保护的对话式 AI 迈向了实用化阶段。 [link]

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis · 2026/2/13

越狱攻击层出不穷,单纯依赖提示词过滤已捉襟见肘。研究者发现,大模型在处理越狱请求时,其内部隐藏层的激活状态会留下独特特征。通过对 LLaMA 和 Mistral 等模型的层级分析,他们构建了一个轻量级的检测框架,无需微调模型即可精准识别风险。该技术甚至能在推理阶段实时阻断攻击,在保持正常响应的同时屏蔽了大部分越狱尝试。这种从黑盒探测转向内部表征监测的范式,为大模型安全治理提供了新路径。 [link]

Yaksha-Prashna: Understanding eBPF Bytecode Network Function Behavior

Animesh Singh, K Shiv Kumar, et al. · 2026/2/13

云原生基础设施极度依赖 eBPF 编写的第三方网络功能,但这些闭源字节码的安全性一直是个黑盒。Yaksha-Prashna 系统的出现改变了现状。它能针对 F5 或 Palo Alto 等厂商提供的字节码,自动验证其是否符合功能规范。通过构建领域特定的程序分析模型,该系统在保证不泄露源码的前提下,为开发者和运营商提供了确凿的可信证明。其验证速度比现有技术快了数百倍,是保障现代化数据中心链路安全的工程利器。 [link]

Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation

Shuyu Chang, Haiping Huang, et al. · 2026/2/13

代码大模型虽好用,却面临中毒后门攻击的威胁。现有的攻击手段往往在隐蔽性与迁移性之间难以兼顾。STAB 方案利用 Sharpness-Aware Minimization 技术,寻找损失函数平原中的对抗扰动。这种策略生成的后门触发器能跨数据集和跨模型稳定生效,即便面对针对性的安全防御也能保持高成功率。这项研究揭示了软件供应链中 AI 模型的深层脆弱性,迫使开发者重新评估代码助手的信任边界。 [link]

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

J Alex Corll · 2026/2/13

攻击者正在通过多轮对话分散恶意意图,绕过单次请求的检测机制。研究者提出了一套名为 Peak + Accumulation 的代理层评分公式,无需调用昂贵的检测模型即可量化风险。该方案结合了单轮风险峰值、持续性比例和类别多样性,能敏锐察觉长线潜伏的攻击。在包含万余条真实对话的数据集测试中,它以极低的误报率实现了超过 90 % 的召回。这种低开销且鲁棒的检测方案,非常适合在大规模工业级网关中部署。 [link]

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

Anushri Eswaran, Oleg Golev, et al. · 2026/2/13

现代 AI 助手需要同时处理数十份文档和复杂的工具输出,其中的一致性问题往往被忽视。研究团队以高风险的加密货币和金融领域为背景,建立了包含 198 个生产环境问题的基准测试集。他们总结出 7 类人类难以察觉的高阶错误,发现顶尖大模型在处理海量结构化数据时容易出现严重失误。这项研究为金融级 AI 开发了严格的评价标准,为解决长文本推理中的幻觉问题提供了关键数据支持。 [link]

LoRA-based Parameter-Efficient LLMs for Continuous Learning in Edge-based Malware Detection

Christian Rondanini, Barbara Carminati, et al. · 2026/2/13

边缘设备资源极其受限,难以运行庞大的安全监测模型。这项研究提出了一种基于 LoRA 的参数高效持续学习架构。它让轻量级 Transformer 模型在各个物联网节点上进行本地微调,仅交换体积微小的适配器模块来实现知识共享。这种方式实现了原始流量隐私保护,并让模型在面对从未见过的变种攻击时,准确率提升了 20 %。这种协同进化的防御体系,解决了分布式环境下的威胁漂移难题。 [link]

Unknown Attack Detection in IoT Networks using Large Language Models: A Robust, Data-efficient Approach

Shan Ali, Feifei Niu, et al. · 2026/2/13

面对日新月异的零日攻击,传统的特征库检测早已失效。SiamXBERT 框架巧妙结合了孪生元学习与 Transformer 语言模型,能够仅凭少量样本识别未知的物联网攻击。它同时融合了流级与包级的行为特征,即便在加密流量环境下也能精准建模。实验证明,该方案在数据稀缺和跨数据集场景下表现卓越,比现有基准提升了近 80 %。这种具备快速演化能力的入侵检测技术,正是万物互联时代亟需的安全防护伞。 [link]

AI 论文

Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation

Lingyong Yan, Jiulong Wu, et al. · 2026/2/13

面对大规模教育视频制作难题,LAVES 框架实现了工业级的突破。它将任务拆解为解题、绘图、解说等多个专业 Agent 协作流程。通过结构化脚本和模版驱动的自动编译,这套系统每日可产出超过 100 万个高质量教学视频,成本降低了 95% 以上。系统运行过程中,每个环节都有显式的质量审查。这种层次化的架构确保了教学逻辑的严谨性,为自动化教育内容的生产提供了可扩展的工业标准。 [link]

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

Sungmoon Kim, Hyuna Jeon, et al. · 2026/2/13

工业界 RAG 落地常被复杂的 PDF 布局和高延迟所困扰。HybridRAG 提出了一种实用主义架构,利用 OCR 技术与布局分析将非结构化文档转为层次化文本。它通过预生成 Q&A 知识库来加速响应,用户提问会优先匹配已知答案。仅在漏配时系统才调用实时生成,这显著提升了答案质量。该方案降低了在高吞吐、计算资源有限环境下的响应时间,为大规模企业级知识库问答提供了更高效的部署路径。 [link]

Voxtral Realtime

Alexander H. Liu, Andy Ehrenberg, et al. · 2026/2/13

实时语音识别在低延迟交互场景中至关重要。Voxtral Realtime 采用了原生流式训练框架,实现了音频与文本之间的高效对齐。该模型在保持亚秒级延迟的同时,识别准确度达到了离线版 Whisper 的水平。借助新的因果音频编码器,它能够在序列增长时维持常数级的计算开销。目前团队已开源 13 种语言的模型权重。该成果攻克了端侧设备实时转录中的计算开销难题,为交互式语音界面提供了核心支撑。 [link]

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

Xiaoyuan Liu, Tian Liang, et al. · 2026/2/13

传统的长文本模型只能被动接收上下文,StateLM 赋予了模型主动管理记忆的权力。它仿照 Pensieve 冥想盆机制,在内部逻辑循环中集成了上下文剪枝、文档索引和笔记记录工具。模型不再受制于固定的 context window 限制,而是学会了动态构建自己的思考空间。在深度研究任务中,该架构表现出惊人的适应性,准确率比标准模型提升了数倍。这种有状态的智能体范式,让 LLM 能够真正处理超长周期的复杂推理任务。 [link]

PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models

Jiawei Xu, Zhenyu Yu, et al. · 2026/2/13

为了攻克算法推理这一顽疾,PRIME 引入了由执行者、验证者和协调者组成的多智能体协作模式。其核心在于利用 group relative policy optimization 进行强化学习,有效防止了错误在推理链中的灾难性传播。该研究配备了目前最大的算法推理基准测试 PRIME-Bench。实验发现,即便是在 8B 小模型上,该框架也能获得极强的推理鲁棒性。它的表现甚至超越了参数量大数倍的模型,为小模型提升逻辑能力提供了关键途径。 [link]

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

Jiayi Zhou, Yang Sheng, et al. · 2026/2/12

当智能体进入高风险领域,确保其行为安全成为了头等大事。FormalJudge 挑战了目前的 LLM-as-a-Judge 范式。它认为概率系统难以可靠地监督另一个概率系统。该框架将自然语言指令编译为可验证的约束,利用 Dafny 规范和 Z3 求解器提供数学级别的确定性保证。这种神经符号架构在检测智能体欺骗行为方面表现优异。在 7B 模型上,它实现了 90% 以上的检测准确率,为大模型的可信治理提供了坚实的验证基础。 [link]

Spend Search Where It Pays: Value-Guided Structured Sampling and Optimization for Generative Recommendation

Jie Jiang, Yangru Huang, et al. · 2026/2/12

生成式推荐模型常因波束搜索的贪婪性导致探索不足。V-STAR 框架通过值引导的结构化采样解决了概率与奖励不匹配的顽疾。它在自演进循环中动态识别高潜力前缀,大幅提升了推荐结果的准确性。同时,该方案也增强了候选集的多样性。研究利用 Sibling-GRPO 强化学习算法在关键决策点集中学习信号。这为工业级推荐系统在严格延迟限制下提升用户参与度,提供了一条清晰且高效的工程改进路径。 [link]

When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification

Jiale Zhao, Ke Fang, et al. · 2026/2/13

大模型面对含糊指令时常会胡乱猜测甚至产生幻觉。AskBench 基准测试将评估视角转向了模型的主动澄清能力,要求模型在信息不足时懂得提问。研究者提出了一种基于规则指引的强化学习方法 RLVR,鼓励模型进行有针对性的交互。这种方法提高了复杂任务的最终准确率,也让 AI 的交互过程更符合人类逻辑。它有效减少了多轮对话中因语义不明造成的信息摩擦,提升了现实场景下的人机协作效率。 [link]

LawThinker: A Deep Research Legal Agent in Dynamic Environments

Xinyu Yang, Chenlong Deng, et al. · 2026/2/13

法律研究追求结果正确,过程中的程序合规同样关键。LawThinker 智能体采用了独特的探索-验证-记忆策略。在每一步知识检索后,系统都会嵌入自动验证环节。DeepVerifier 模块会从准确性、关联性和合规性三个维度审视引用条文,杜绝了虚假法条的传播。针对长周期任务,其内存管理模块实现了知识的跨轮重用。这显著提升了动态司法环境下的决策质量,也为构建严谨的专业领域深度研究智能体提供了典范。 [link]

Multimodal Fact-Level Attribution for Verifiable Reasoning

David Wan, Han Wang, et al. · 2026/2/13

现实世界的推理往往横跨视频、音频等多种模态。MuRGAt 基准测试关注多模态场景下的事实级溯源能力。它要求模型给出推理过程,并精确指认证据所在的时间段与模态来源。研究发现,顶尖模型在深度推理时也常会出现虚假引用。该研究引入的自动化评估框架与人类判断高度一致。它为构建可验证的多模态推理系统提供了关键标尺,揭示了模型内部推理逻辑与外部证据支撑之间存在的巨大能力差距。 [link]

BleepingComputer 新闻

Russia tries to block WhatsApp, Telegram in communication blockade

Bill Toulas · 2026/2/13 6:57

俄罗斯政府正试图在境内封锁 WhatsApp。针对非受控通信平台的打击力度正在加强,该封锁行动是其中的重要环节。 [link]

Microsoft fixes bug that blocked Google Chrome from launching

Sergiu Gatlan · 2026/2/13 17:31

微软修复了一个已知问题。该问题曾导致 Family Safety 服务阻碍 Windows 用户启动 Google Chrome 以及其他浏览器。 [link]

CISA flags critical Microsoft SCCM flaw as exploited in attacks

Sergiu Gatlan · 2026/2/13 20:35

CISA 要求联邦机构加固系统以应对 Microsoft Configuration Manager 中的关键漏洞。该漏洞已于 2024 年 10 月修复,目前正被攻击者利用。 [link]

Turning IBM QRadar Alerts into Action with Criminal IP

Sponsored by Criminal IP · 2026/2/13 23:05

Criminal IP 现已集成至 IBM QRadar SIEM 与 SOAR 平台。它将外部 IP 威胁情报直接引入检测与响应流程。通过风险评分与自动化富化,SOC 团队无需离开 QRadar 即可优先处理高风险 IP 并加速调查。 [link]

Louis Vuitton, Dior, and Tiffany fined $25 million over data breaches

Bill Toulas · 2026/2/14 2:35

韩国对 Louis Vuitton、Christian Dior Couture 以及 Tiffany 处以 2500 万美元罚款。由于未能采取充分的安全措施,这些品牌导致超过 550 万名客户的数据遭到非法访问与泄露。 [link]

Claude LLM artifacts abused to push Mac infostealers in ClickFix attack

Bill Toulas · 2026/2/14 4:21

威胁参与者正利用 Claude artifacts 与 Google Ads 开展 ClickFix 攻击活动。攻击者通过该手段向搜索特定词条的 macOS 用户分发 infostealer 恶意软件。 [link]

由 CyberRadar 智能体编写
消息抓取于 2026/2/13 6:55 至 2026/2/14 6:58