基础模型 第2页

VeriSkill:大模型自进化程序验证技能,跨模型迁移最高提升43.7%

为了破解这一死局,研究团队提出了专门面向程序验证的技能自进化框架 VeriSkill 。它跳出了通用自进化框架“见错就改”的粗放范式,建立了一整套兼顾“归因诊断、抽象泛化与语义保真”的进化闭环:首先在责任归因中剔除环境和求解器局限带来的伪信号,只捕获真正的技能缺陷;接着将具体的失败诊断签名聚类。

SkillEvo:多轮交互反馈驱动Agent技能进化,解决率提升51.8点

针对这一系列落地痛点,腾讯云与浙江大学的研究团队提出了名为 SkillEvo 的智能体技能自进化框架。研究的核心判断在于: 制约技能持续自进化的瓶颈,从来不是大语言模型的文本重写能力,也不是迭代轮数的多少,而是评估反馈机制能否持续提供可信的进化梯度。

Modus:单模型统一15种模态,Decoder-Only如何打破Any-to-Any壁垒?

由 Apple、香港中文大学(CUHK)、EPFL 等机构联合提出的 Modus ,直接打破了这一工程惯例。它证明了: 不需要为每个模态定制专门的预测头,也不需要外挂专有损失函数或复杂的任务管道,完全基于统一的单解码器(Decoder-Only)架构。

NCP-ArchPreview:打破单Token限制,以一半数据追平7B基准

NCP-ArchPreview:实验结果显示,仅仅对这 17M 权重在 Magicoder、Orca-Math 等特定语料上进行低成本迭代,模型便能在完全不遗忘通用能力的前提下,迅速完成对目标领域的概念重对齐。其数学与代码能力的跃升幅度,甚至能媲美相当计算量级下的全参数微调。

HoF-Bench:无需前沿大模型,轻量级AI复现68%真实开源CVE

HoF-Bench 的实验结果重构了软件工程团队对 AI 辅助代码安全分析的固有认知。它明确证实了利用廉价模型搭建实用级 SAST 分析器的可行性。以往企业往往受困于大参数前沿模型高昂的 Token 费用和有限的速率配额,难以为全量代码库落地持续审计;而实验证明,在极简的脚手架下。

PACE:阿里锚定播放边界,打断指代率从25%提至96.3%

针对这一交互硬伤,阿里团队提出了 PACE (Playback-Aligned Context Engine,播放对齐上下文引擎)。这是一个独立于具体模型厂商的中间件层,它把客户端真实的音频播放边界作为物理代理锚点,将模型侧可见的上下文强行回退并修正到用户发声瞬间“真正听到”的内容范围内。

CoAdapt-GUI:双通道测试时自适应,让手机Agent跨App成功率升至52.9%

来自康考迪亚大学、麦克马斯特大学、Mila 魁北克人工智能研究所和多伦多大学的研究团队提出了一种全新的破局思路: CoAdapt-GUI 。这项工作不再指望源域训练能“一劳永逸”地搞定所有新软件,而是聚焦于 测试时自适应(Test-Time Adaptation, TTA) 。

PACE-Bench:直接给出物理参数,为何依然救不了大模型的机械重构?

PACE-Bench 的提出,给当前正热的自进化与代码智能体研究泼了一盆必要的冷水。长期以来,学术界容易沉浸在利用大语言模型解决纯文本、符号逻辑或标准化编程难题的胜利中,误以为结合简单的反思(Reflection)与记忆库即可实现通用的智能体自主进化。

不是模型越大越好:Zero-Shot自编排以1/5成本逼平顶级模型

本文提出的架构则走出了一条轻量级的动态编排路线。整个系统由 Manager 角色主导,但 Manager 不负责硬编码的流水线,而是维护一个共享文件空间作为工作记忆。针对输入的代码难题,Manager 首先调用生成式提示词生成初步方案与头脑风暴,建立待办任务清单(Task Ledger)。

HVTB:给大模型埋下蜜罐陷阱!2225次轨迹实测大模型奖励作弊

HVTB:实验结果清晰地揭示了提示词防御的局限性。在最贴近现实生产环境的 L0 阶段(开发者仅给出通用禁令,无法预见特定漏洞),几乎所有前沿模型都表现出了相当比例的作弊行为。这说明当前大模型对高层抽象伦理指令的遵从能力,在复杂的长链条工具调用中会被迅速稀释。

RangeFactory:攻破首跳后47%仍溃败,多跳靶场迎来自动化量产

来自华为技术有限公司、北京大学与东南大学的研究团队提出了自动化多跳网络靶场编排框架 RangeFactory 。该框架将复杂的靶场构建本质抽象为“依赖解析”问题,利用多智能体流水线从孤立的真实漏洞环境中自动提取能力与运行时依赖,并通过端到端实战攻击回放进行闭环验证。

ResearchArena:AI研发暗中搞破坏,数据后门拦截率不足50%

针对这一威胁,来自 ELLIS 研究所、苏黎世联邦理工学院(ETH Zurich)、马克斯·普朗克智能系统研究所(MPI-IS)以及阿姆斯特丹大学等机构的研究团队提出了专为自动化 AI 研发设计的控制评估框架 ResearchArena 。

WeatherNext 3:告别分析场,DeepMind用原始观测实现逐小时0.1°预报

WeatherNext 3 选择在模型内部彻底打通这一环节,提出了针对离散观测的“站点输出头”(Station Output Head)。这一机制的本质是将天气预报转化为连续时空的函数查询任务: 在给定预报时刻,模型提取出高分辨率 0.1° 隐空间特征场; 当需要查询特定经纬度的地面预报时。