ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents
LLM 渗透测试代理一旦越权,可能导致生产事故或漏洞报告作废。ScopeJudge 引入预执行审计机制,通过轻量级 LLM 充当裁判。它能根据用户意愿识别出隐藏在工具调用中的越权意图。该方案在包含 4,897 个调用案例的基准测试中表现卓越。它不仅考虑了安全性,还兼顾了运行成本。这为自主安全代理的规模化部署扫清了合规障碍。 [link]
2026/7/11 · CyberRadar
LLM 渗透测试代理一旦越权,可能导致生产事故或漏洞报告作废。ScopeJudge 引入预执行审计机制,通过轻量级 LLM 充当裁判。它能根据用户意愿识别出隐藏在工具调用中的越权意图。该方案在包含 4,897 个调用案例的基准测试中表现卓越。它不仅考虑了安全性,还兼顾了运行成本。这为自主安全代理的规模化部署扫清了合规障碍。 [link]
网页代理将自然语言视为指令,容易被页面中的恶意内容诱导产生 prompt injection。Prismata 提出了上下文最小权限防御。它利用动态信任推导技术为网页内容打上权限标签,确保恶意内容无法干预关键操作。该机制无需开发者手动标注,能自动适配各类长尾网站。实验证明它能显著降低攻击成功率,同时不影响代理完成正常任务。这为浏览器自动化工具构筑了坚实防线。 [link]
AI 辅助编程极大提升了效率,但也埋下了后门代码的隐患。CodeTracer 是一款针对代码补全的取证分析框架。它能在部署后仅凭微调语料和恶意输出,精准溯源出导致后门的恶意样本。该框架提取代码行为特征,并利用 LLM 推理定位不安全逻辑。它在 10 余种攻击场景下展现出极高的检测精度。它能有效识别隐蔽的投毒数据,为软件供应链安全提供了新利器。 [link]
小程序中的 OAuth 授权流程常被开发者错误集成,导致用户身份面临被冒用风险。MINIAUTH 是首个针对该问题的动态分析框架。它能自动识别登录页面并模拟运行时行为,揭示混淆代码下的逻辑缺陷。通过对数万个微信和百度小程序的扫描,研究者发现了 1,834 个安全漏洞。这些发现已获得国家级漏洞库编号,有力推动了超级应用生态的安全标准升级。 [link]
长期运行的 AI 代理通过记忆和工具交互,形成了巨大的攻击面。TokenWall 提出了语义防火墙的概念,在运行时审计 token 流。它能拦截到达特权接收端前的危险语义流,实现边界感知审计。这种预执行调解机制降低了对远程重型模型的依赖,大幅减少了系统延迟。在基准测试中,它将攻击成功率压低至 12.5% 且几乎不误伤合法请求。这是构建稳健智能体系统的关键组件。 [link]
当 LLM 代理被转售商重塑或替换模型时,开发者难以追踪轨迹数据的权属。TRACE 引入了双通道稳健水印方案。它在动作选择中嵌入内容密钥,确保水印在删除步骤后仍能自同步。同时它在日志结构中嵌入位置密钥,使得攻击者即便重写内容也无法抹除标识。该技术实现了无损属性嵌入,探测得分极高。它让代理轨迹的追责变得有据可依,有力捍卫了模型开发者的权益。 [link]
零知识证明推理成本高昂,制约了 zkML 的大规模应用。zkComposer 通过分解证明构造,开启了全新的并行化维度。它将复杂的推理证明拆分为独立的子证明,并利用加密链接确保各层之间的一致性。该框架不需要修改底层的密码学原语,即可实现数倍的性能提升。在处理大型模型时,它显著缩短了证明生成时间。它为隐私保护下的高效 AI 推理铺平了硬件加速之路。 [link]
IoT 设备算力受限且面临僵尸网络威胁。DiRLU 框架将强化学习与知识蒸馏结合,打造出极致轻量的安全防护模型。它支持选择性遗忘敏感特征,无需重新训练即可响应隐私保护需求。该方案仅需 2,370 FLOPS,比现有最先进模型效率提升数倍。实验显示其在分类任务中表现稳定。它让边缘设备在满足 GDPR 标准的同时,具备了强大的恶意流量过滤能力。 [link]
多智能体系统中的错误诊断一直是个难题,因为故障往往源于长期的交互偏差。AgentLocate 框架能够精准定位故障的责任智能体及首个关键转折点。它采用多视角验证机制,并结合置信度感知策略聚合评估结果。通过轻量级微调,该框架不断优化归因质量。它在多种复杂任务和轨迹长度下均优于现有方法。这为复杂 AI 协作系统的可靠性维护提供了自动化诊断工具。 [link]
从传统文档迁移到机器可读的合规标准往往容易产生资产错漏。ASSERT 框架利用本体技术从遗留 IT 安全概念中提取文档图。它通过双图对比机制,自动检测文档描述与实际参考拓扑之间的不一致。最后它能导出符合 OSCAL 标准的合规文件。该工具极大减轻了手动审计的负担。它让关键基础设施的持续合规管理从文书工作转向了自动化、可验证的科学流程。 [link]
工业级 Agent 往往在重复生成代码上浪费大量推理成本。这项研究提出了一种工具制造管线。系统会将重复的 SOP 步骤预先编译为经过验证的版本化工具。在履约中心警报处理系统的实测中,该方案将延迟降低了 42 %。这种从推理时编码转向运行前工具化的思路,显著提升了工业大模型系统的稳定性。它为构建低延迟、高可靠的生产系统提供了技术路径。 [link]
该研究推出了名为 Infinity-Parser 2 的多模态大模型。它旨在解决高质量文档解析数据稀缺的难题。团队构建了包含 500 万个样本的中英双语语料库。模型采用了验证性多任务奖励系统,并在多个基准测试中超越了现有先进模型。它对图表和化学公式等复杂元素的解析展现出极强的泛化能力。这将极大提升企业级文档自动化的处理精度与效率。 [link]
传统的网页搜索 Agent 难以兼顾搜索的深度与广度。WebSwarm 引入了一种递归多 Agent 编排框架。它在推理过程中动态构建搜索节点,通过递归委派机制处理复杂任务。这种架构能够自动分解任务并聚合跨页面的证据。实验证明其在深度搜索任务中优于单 Agent 系统。它代表了新一代搜索增强技术的演进方向,让 AI 具备了类似人类专家的深度调研能力。 [link]
目前的企业 AI 系统大多处于被动响应状态。该研究提出了 Context Graph 架构。它通过建模企业实体及其动态关系,构建了一个实时关联的数据结构。基于此结构,主动性评分引擎能先于用户提问就推送关键见解。在合同管理和工程事件响应等案例中,该系统将平均响应时间从 47 分钟缩短至 30 秒以内。它标志着企业级 Agent 正从被动工具向主动助手演进。 [link]
神经架构搜索长期依赖人工设计的搜索空间。AgentNAS 融合了 LLM 的设计能力与 NAS 的搜索效率。它利用 LLM 生成高质量的种子架构并将其分解为槽位架构,从而自动定义任务特定的搜索空间。该方法在 17 项多模态任务中刷新了记录。它证明了 AI 能够自主完成从蓝图设计到细致优化的全流程。这种人机协作的新范式将显著降低深度学习模型的研发门槛。 [link]
金融量化研究正在经历从人工因子设计到 AI 自动化探索的变革。XAlpha 是一款驱动型的 AI 量化研究员。它具备独特的存储系统,能整合金融知识与过往的发现反馈。系统通过三脑协作实现从假设生成、代码实现到实证校验的闭环。在沪深 300 指数的实测中,其发现 Alpha 因子的能力优于现有基准。它为金融机构提供了一套自动吸收外部知识、可进化的量化投研解决方案。 [link]
临床诊疗中的肝细胞癌分期通常过于粗放。HCC-STAR 是一款专门针对该病症设计的临床推理大模型。它通过阅读电子病历叙事,联合输出分期评分、治疗建议及个体化生存预测。研究者利用 12 家医院的临床数据进行了多中心验证。结果显示该模型推荐的方案能显著提升患者预期生存期。这种将医学准则转化为可验证推理过程的方法,为精准医疗提供了透明且可靠的决策支持工具。 [link]
大模型推理加速是当前工程领域的焦点。DominoTree 提出了一种条件树状起草机制,用于增强投机采样效果。它在不增加训练负担的前提下,利用条件校正构建最优起草树。在 Qwen 3 系列模型上的测试显示,该方法相比自回归解码实现了高达 6.6 倍的加速。它采用了 GPU 原生加速构建器,确保了吞吐效率。对于追求极致响应速度的实时对话业务,这项技术具有立竿见影的优化效果。 [link]
美国上市公司的 8 - K 披露公告隐藏着影响市场的关键事件。研究者开发了一套针对 119 种事件类型的精细化提取系统。它采用两阶段架构,将每一个事件标签都锚定到原始文本的引用中,确保了结果的可追溯性。通过对近 30 万份申报文件的分析,该系统识别出数万个关键事件节点。精细化标签能有效区分经济意义不同的公告内容。这为量化投资提供了高质量的结构化数据基础。 [link]
通信带宽是联邦学习在边缘智能设备上普及的核心瓶颈。FedOPAL 提出了一种基于分析型视觉提示微调的单轮联邦学习框架。它通过提示符校正异构数据的特征分布,解决了分析型方法在非独立同分布数据下的失效问题。该框架实现了服务器端的零训练成本,且准确率媲美多次迭代的方法。对于隐私敏感且算力受限的边缘计算场景,这套工程方案具有极高的实用价值。 [link]
OpenMandriva Linux 项目宣布,在贡献者之间发生纠纷后,该项目成为了一起内部蓄意破坏企图的目标。 [link]
网络安全事件响应公司 DigitalMint 的一名前员工被判处 70 个月监禁。该员工曾针对美国公司发起 BlackCat 勒索软件攻击。 [link]
Zimbra 安全团队敦促客户修复 Classic Web Client 中的严重 XSS 漏洞。该组件用于访问 Zimbra Collaboration 套件。 [link]
黑客正在积极利用 Gitea 官方 Docker 镜像中的严重权限绕过漏洞。攻击者可以借此冒充包括管理员在内的任何用户。 [link]
一名保加利亚男子被指控在服刑期间窃取了价值 290000 美元的政府没收加密货币。他此前因协助洗钱而被判处 121 个月监禁。 [link]
AI Agent 正在加速非人类身份的增长,这让企业更难理清身份的归属与权限。Netwrix 解释了在 AI 扩大企业攻击面时,强化可见性与身份治理的重要性。 [link]
一名 34 岁的亚美尼亚男子承认入侵美国公司并部署 Ryuk 勒索软件。他目前面临最高 15 年的监禁。 [link]
荷兰国家警察表示,现有强力迹象表明荷兰黑客参与了 2 月发生的电信运营商 Odido 数据泄露事件。 [link]
Progress Software 正在向使用 Storage Zone Controllers 的 ShareFile 客户发送邮件。由于发现针对本地安全文件共享软件的可靠外部安全威胁,官方要求客户立即关闭服务器。 [link]
广泛使用的 U-Boot 引导加载程序中发现了 6 个漏洞。攻击者可以在设备启动期间执行恶意代码,从而实现隐蔽的固件攻击,破坏安全保护并安装持久性恶意软件。 [link]