网络安全论文
Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction
Tran Vy Khang, Nguyen Dang Nguyen Khang, et al. · 2026/3/31
自动化渗透测试常因环境复杂与内存断层难以应用。Red-MIRROR 引入反射验证与知识增强机制,通过多智能体协作攻克难题。该系统在 XBOW 基准测试跑出 86 % 的成功率,远超同类智能体。它能有效记忆长期会话,并像专家一样对攻击载荷进行持续修正。对于想提升 Web 安全防御能力的开发者,这套开源方案提供了极具价值的工程参考。 [link]
Ordering Power is Sanctioning Power: Sanction Evasion-MEV and the Limits of On-Chain Enforcement
Di Wu, Yuman Bai, et al. · 2026/3/31
以太坊上的制裁封锁并非万无一失。当发行方的冻结指令遇上黑客转账请求,胜负往往由区块排序权决定。这项研究揭示了 SE-MEV 这种新型价值提取行为,量化了超过 15 亿美元的封锁资产。调查发现 18.7 % 的受制裁 USDC 地址在封印前成功清零。文中构建的博弈模型指出,只要排序权受经济利益驱动,链上制裁就存在天然漏洞。 [link]
SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do
Aditya Dhodapkar, Farhaan Pishori · 2026/3/31
大模型智能体单步操作看似安全,累加起来却可能导致严重的数据泄露。SafetyDrift 另辟蹊径,将安全轨迹建模为吸收马尔可夫链,在违规发生前精准预判风险。相比笨重的 LLM 裁判,该方案运行速度快了 60000 倍,能提前近 4 步发出警报。它为智能体部署提供了轻量级的实时监控,让 AI 在越界前就被按下停止键,具有极高的实操价值。 [link]
"Elementary, My Dear Watson." Detecting Malicious Skills via Neuro-Symbolic Reasoning across Heterogeneous Artifacts
Shenao Wang, Junjie He, et al. · 2026/3/31
智能体技能市场正在成为软件供应链的新威胁。恶意技能常潜伏在看似无害的配置和代码中。MalSkills 框架结合符号解析与神经推理,能跨越不同工件追踪敏感操作。通过对 15 万个真实技能进行扫描,研究者成功揪出 76 个此前未知的恶意插件。这种神经符号结合的方法,为保护智能体生态系统提供了兼具深度与广度的安全底座。 [link]
A Systematic Taxonomy of Security Vulnerabilities in the OpenClaw AI Agent Framework
Surada Suwansathit, Yuxuan Zhang, et al. · 2026/3/31
AI 智能体框架将模型推理与底层系统直接连接,引入了传统软件从未见过的攻击面。通过对 OpenClaw 运行时 190 条安全通告的分析,研究者整理出一套多维漏洞分类法。他们利用网关与节点子系统的三个中高危漏洞,成功构造出一条完整的远程代码执行路径。这项研究提醒开发者,依靠简单的命令黑名单无法防御利用 Shell 特性的巧妙绕过。 [link]
SPARK: Secure Predictive Autoscaling for Robust Kubernetes
Zhijun Jiang, Amin Milani Fard · 2026/3/31
传统的 Kubernetes 自动伸缩器面对 DDoS 攻击或突发流量时,反应通常较为迟缓。SPARK 方案引入 eBPF 网络层,在内核态强制执行安全策略,并结合预测模型进行伸缩决策。实验表明系统能将流量激增时的超时错误降低 32 %。这种将内核技术与预测性编排相结合的思路,为构建韧性云原生基础设施提供了工业级的落地方案。 [link]
Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers
Haochuan Kevin Wang · 2026/3/31
提示词注入如何穿透层层防御?研究者通过植入加密标记,追踪了攻击在暴露、持久化、中继和执行四个阶段的演变。实验对比五大模型发现,Claude 倾向于在记忆总结阶段拦截攻击,而 GPT-4o-mini 则容易透传恶意载荷。这一发现揭示了模型安全不在于是否看到干扰,而在于是否允许跨阶段传播。这种分阶段解耦分析法为防御复杂注入指明了方向。 [link]
VulnScout-C: A Lightweight Transformer for C Code Vulnerability Detection
Aymen Lassoued, Nacef Mbarek, et al. · 2026/3/31
百亿参数的大模型固然强大,但在开发流水线中部署成本太高。VulnScout-C 是一款仅有 6.9 亿参数的轻量级 Transformer,专为 C 语言漏洞检测优化。它在基准测试中的表现超过了体积更大的商业静态分析工具。对于追求低延迟、高频扫描的团队,这款模型平衡了检测精度与推理开销,是集成到 CI/CD 流程的理想选择。 [link]
Empowering Mobile Networks Security Resilience by using Post-Quantum Cryptography
Ricardo Alves Faval, Rodrigo Moreira, et al. · 2026/3/31
量子威胁迫在眉睫,先存储后解密攻击让当前的 5G 信令面临巨大风险。这项研究在开源 5G 核心网 free5GC 中集成了 NIST 后量子加密标准。通过 Sidecar 代理模式,团队实现了对原有网络功能的无侵入升级。测试结果显示 PQC 增加了约 48 毫秒的端到端时延,但性能波动极小。该方案为运营商向抗量子网络迁移提供了一条稳健的实施路径。 [link]
Safeguarding LLMs Against Misuse and AI-Driven Malware Using Steganographic Canaries
Md Raz, Venkata Sai Charan Putrevu, et al. · 2026/3/31
敏感文档被上传至第三方 AI 平台会导致严重的合规风险。该框架利用隐写术植入加密标识,即便经过格式转换或语义编辑也能被稳定检出。该框架支持在现有文档中注入不可见符号,也可以通过语言隐写生成高仿真诱饵文件。在针对勒索软件管道的实测中,系统能在文件加密前成功拦截非法上传。它为企业数据防泄露提供了一道坚实的防护墙。 [link]
AI 论文
Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange
Yin Cheng, Liao Zhou, et al. · 2026/3/31
电商推荐系统通过公式分配排序权重,但离线指标往往误导在线收益。 Sortify 作为首个全自动 LLM 驱动的排序优化 Agent ,已在东南亚大型电商系统上线。它将排序建模为持续的 影响交换 ,利用 Memory DB 实现闭环优化。在实际部署中,该系统将 GMV 提升了 9.2% ,广告收入增长 3.58% 。它为大规模生产环境下的推荐系统参数调优提供了可落地的工程范式。 [link]
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
He Du, Qiming Ge, et al. · 2026/3/31
自动生成高性能 GPU 算子是提升推理速度的关键。 Kernel-Smith 框架通过演化 Agent 持续优化代码,结合 Triton 与 Maca 后端实现了极高的编译与执行效率。该框架在 KernelBench 榜单上超越了 Claude 4.6 等顶尖模型,并在 SGLang 等开源项目中贡献了实际生产算子。它将模型从一键式生成器转变为本地持续优化器,显著降低了异构计算平台的适配成本。 [link]
KAT-Coder-V2 Technical Report
Fengxiang Li, Han Zhang, et al. · 2026/3/31
针对软件工程和 Web 编程等垂直领域,快手团队推出了 KAT-Coder-V2 智能编码模型。该模型采用 先专业后统一 的范式,在五个专家领域独立进行强化学习,最终通过在线蒸馏合并。为了支撑训练,团队构建了 KwaiEnv 沙盒基础设施,支持数万个实例并发。模型在 SWE-bench 取得了 79.6% 的高分,足以抗衡主流闭源模型。它是目前工业界编码智能化的重要里程碑。 [link]
daVinci-LLM:Towards the Science of Pretraining
Yiwei Qin, Yixiu Liu, et al. · 2026/3/31
这份 预训练科学 指南为学术界提供了极其珍贵的底层工程参考。 daVinci-LLM 完整公开了从 8T 语料处理到 3B 模型训练的全过程。研究团队提出 Data Darwinism 体系,对数据进行精细的分类与合成,并建立了多达 200 项控制变量实验。该项目打破了工业界对训练细节的垄断。它在数据清洗和课程学习方面的实践经验具有极高的工程应用价值。 [link]
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
Bin Zhu, Qianghuai Jia, et al. · 2026/3/31
深度研究 Agent 需要在长程任务中保持推理的一致性。 Marco DeepResearch 提出以 验证为中心 的设计框架,在数据合成、轨迹构建和推理阶段全面引入验证机制。这种设计让 8B 规模的模型在挑战性榜单上甚至能超越 30B 规模的对手。通过自主纠错和多轮验证,它极大缓解了 Agent 在复杂任务中的幻觉累积问题。它是低成本实现高性能垂直研究工具的典范。 [link]
LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications
Alexandre Cristov\~ao Maiorano · 2026/3/31
开发者常为 RAG 应用何时能上线而困扰。 LLM Readiness Harness 将模型评估转化为自动化的 部署决策流 。它结合了 OpenTelemetry 观测数据和 CI 质量门禁,从召回率、延迟到成本多维度计算 帕累托前沿 得分。实验证明该框架能有效拦截不安全的 Prompt 变体,确保线上服务的稳定性。对于追求工程可靠性的 AI 团队来说,这是实现 生产就绪 的必备基础设施。 [link]
DSevolve: Enabling Real-Time Adaptive Scheduling on Dynamic Shop Floor with LLM-Evolved Heuristic Portfolios
Jin Huang, Jie Yang, et al. · 2026/3/31
制造车间的调度问题因机器故障和新订单插入而极具挑战。 DSevolve 框架利用 LLM 演化出一套高质量且多样化的 调度规则库 ,实现了秒级在线响应。通过 指纹识别 机制实时捕捉生产线状态,系统能从知识库中检索并匹配最佳调度策略。在 500 个真实工业场景实验中,其表现优于深度强化学习方案。它证明了自主智能体在解决复杂 离散制造 调度问题上的巨大潜力。 [link]
Resolving the Robustness-Precision Trade-off in Financial RAG through Hybrid Document-Routed Retrieval
Zhiyuan Cheng, Longying Lai, et al. · 2026/3/31
金融文档 RAG 常面临跨文档片段混淆的问题,传统的 Chunk 检索 难以平衡鲁棒性与精度。 HDRR 提出两阶段混合路由架构,先通过文档级过滤器锁定目标,再进行精准检索。在 FinDER 基准测试中,该方法将错误率从 22.5% 降至 6.4% ,准确率提升显著。它解决了结构化金融报告中常见的定位难题,为高价值行业的 知识库问答 提供了更稳健的技术路径。 [link]
SCOPE: Tree-based Self-Correcting Online Log Parsing via Syntactic-Semantic Collaboration
Dongyi Fan, Suqiong Zhang, et al. · 2026/3/31
日志解析是自动化系统运维的基石,但传统启发式方法常遗漏语义信息。 SCOPE 首次提出 自我修复 的在线解析方法,通过双向树结构加速模板匹配。它采用两阶段协同框架,先用轻量级 NLP 模型进行词性标注匹配,仅在不确定时才调用 LLM 进行语义修复。这在保持极高准确率的同时大幅降低了推理成本。它是实现 智能化运维 且兼顾效率的优秀工程案例。 [link]
PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision
Zehua Han, Jing Xiao, et al. · 2026/3/31
电磁领域的数据稀缺且专业性极强,通用大模型难以胜任感知与决策。 PReD 作为首个面向电磁领域的 基础模型 ,涵盖了从信号发现到 抗干扰决策 的完整闭环。研究者构建了 1.3M 规模的多模态数据集,支持时域波形、频谱图和星座图等多种表征。模型实现了从 信号理解 到逻辑推理的跨模态对齐。它为通信与雷达系统的智能化演进提供了强大的底座支持。 [link]
BleepingComputer 新闻
Dutch Finance Ministry takes treasury banking portal offline after breach
Sergiu Gatlan · 2026/3/31 15:52
荷兰财政部正在调查两周前发现的网络攻击。调查期间,该部门下线了部分系统,包括国库银行数字门户。 [link]
CISA orders feds to patch actively exploited Citrix flaw by Thursday
Sergiu Gatlan · 2026/3/31 15:05
美国 CISA 要求政府机构在周四前修复其 Citrix NetScaler 设备。这些设备存在一个正被利用的活跃漏洞。 [link]
Hacker charged with stealing $53 million from Uranium crypto exchange
Sergiu Gatlan · 2026/3/31 17:15
美国检察官起诉了一名马里兰州男子。该男子两次入侵 Uranium Finance 加密货币交易所,盗取超过 5300 万美元。随后他通过加密货币混币器洗钱。 [link]
Microsoft fixes Outlook Classic crashes caused by Teams Meeting add-in
Sergiu Gatlan · 2026/3/31 20:04
微软修复了一个已知问题。此前启用 Microsoft Teams Meeting Add-in 的用户无法正常使用经典版 Outlook 邮件客户端。 [link]
How to Categorize AI Agents and Prioritize Risk
Sponsored by Token Security · 2026/3/31 22:00
AI agent 的风险各不相同。风险等级随系统访问权限和自主程度提升。Token Security 解释了 CISO 该如何对 agent 分类,并确定安全防护的优先级。 [link]
Hackers compromise Axios npm package to drop cross-platform malware
Bill Toulas · 2026/3/31 21:53
攻击者劫持了 Axios 包的 npm 账户。Axios 是一个每周下载量超过 1 亿次的 JavaScript HTTP client。攻击者利用它向 Linux、Windows 和 macOS 系统投放远程访问木马。 [link]
Cisco source code stolen in Trivy-linked dev environment breach
Lawrence Abrams · 2026/4/1 1:53
思科遭受了网络攻击。攻击者利用近期 Trivy 供应链攻击中窃取的凭据,入侵了思科内部开发环境。公司及其客户的源代码已被窃取。 [link]
Claude AI finds Vim, Emacs RCE bugs that trigger on file open
Bill Toulas · 2026/4/1 5:45
研究人员通过 Claude 助手的简单提示,发现了 Vim 和 GNU Emacs 编辑器中的漏洞。这些漏洞允许用户仅通过打开文件就触发 RCE。 [link]