模型训练 第2页

WebGrader:可执行评测自进化,8B模型网页生成逆袭480B巨兽

来自北京理工大学、北京交通大学和中国人民大学的研究团队提出了 WebGrader ,针对上述痛点提供了一种全新解法:他们将开放式网页生成的强化学习表述为一个 可执行奖励构建(Executable Reward Construction) 问题。

LinkedIn自演化客服Agent:免模型微调,工单路由准确率提升30.6%

LinkedIn 建立了一套高度解耦的模块化评估框架,将客服交互质量拆解为互不干扰的独立维度,并分别设计评估策略: - 接地性与事实依据(Groundedness) :专门校验 Agent 生成的每一条事实性断言是否严格由检索到的文档支撑,一旦出现文档未提及的技术细节或操作指引,直接判定为幻觉。

Explorative Modeling:打破多步生成魔咒,预训练第三轴让效率提升4.1倍

自AlexNet掀起现代深度学习的浪潮以来,AI领域建立了一条近乎公理的演进路径:端到端(end-to-end)训练总能击败手工切分的分阶段流水线。从早期的图像分类、物体检测,到语义分割与端到端语音识别,凡是允许模型直接从数据中学习完整映射的任务,其性能和泛化边界都得到了质的飞跃。

LabEvolver:无需训练的经验进化机制,湿实验耗时缩减48%!

当前的自动化科学发现正在向“第五范式”迈进,即依赖自动驾驶实验室(Self-drivinglaboratories,SDLs)通过机器人实现高通量实验。然而,在这个看似前沿的领域中,存在一个极为底层的痛点:绝大多数湿实验智能体仍停留在“无记忆”的静态执行阶段。

Google DeepMind提出ResidencyRL:多轮RL训练临床AI,遗漏风险降低31%

在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者的多样化反馈,并逐渐承担更大的独立决策权。

Robostral Navigate:单目视觉超越多相机系统,训练Token缩减22倍

当整个行业都在试图通过堆叠激光雷达、深度相机全景阵列甚至预先构建的高精地图来提升机器人的导航成功率时,Mistral团队给出了一个截然不同的答案。他们带来的最新成果RobostralNavigate,不仅是一个拥有80亿参数的视觉语言模型(VLM),更代表了一种极简、高泛化性的具身智能扩展路线。

Faraday:基于GRPO的长视野训练,27B AI科学家复现论文超越Claude!

科学研究的基石在于可复现性。一个好的科学解释应当能够经受住反复的验证:在相同的实验条件下,应当能得出相同的结果。然而,当代科学特别是机器学习领域,正面临着严峻的“复现危机”。理论上,基于大语言模型(LLM)的智能体有潜力成为解决这一危机的可扩展方案,但在实践中,让AI独立完成论文复现一直是个未...

UC Berkeley提出表征引导:无需微调控制工具调用,准确率升至0.56!

让大模型从一个只会聊天的文本生成器,转变为能够解决实际问题的智能体(Agent),其核心跨越在于赋予模型调用外部工具的能力。不论是查询实时搜索引擎、运行Python脚本,还是发送邮件、执行SQL数据库操作,决定“在什么时候使用工具”不仅是智能体认知能力的核心体现,更是工业界落地时必须精打细算的...

Echoverse:不是单纯堆数量,环境与模型协同进化让9B模型成功率达67.1%

计算机使用智能体(Computer-UseAgents)的发展正面临一个残酷的物理屏障:它们无法在真实世界中自由地试错。一个智能体只有在它的行为产生实际后果时,才能真正学到东西。一次点击改变了保存的状态,一条信息送达了真人,或者一个拒绝跳转的页面告诉智能体“你刚才的操作无效”——这些都是宝贵的反馈。

MOPD:小米等提出多教师同策略蒸馏,归一化得分提升5.5分!

在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规则反馈优化指令遵循能力,针对单一领域的强化学习管道往往能够稳定且大幅度地提升...

\text{Muon}^p:分数阶谱幂更新机制,全面提升十亿级大模型微调性能

在深度学习尤其是大语言模型的训练中,优化器的设计直接决定了模型学习的效率与最终的性能上限。长期以来,AdamW等基于标量动量和方差调整的优化器占据了主导地位。然而,随着模型规模的爆炸式增长,研究人员开始将目光投向利用权重和梯度矩阵结构的二阶或伪二阶优化器。

AgentLocate:多视角验证与微调机制,精准定位多智能体故障

在基于大语言模型(LLM)的复杂应用前沿,多智能体系统正在成为解决跨领域复杂任务的核心范式。通过将不同的职责分配给具备专门设定的智能体,系统能够实现更丰富的推理、更灵活的规划以及跨越多个工具的协调工作流。

斯坦福揭示数据过滤的苦涩教训:当算力充沛时,无过滤才是最优解

长期以来,大语言模型预训练的数据清洗被视作不可逾越的金科玉律。业界普遍认为,必须将海量网页数据精心过滤,剔除低质量内容,才能喂给模型。然而,斯坦福大学的一项最新研究,向这一常识投下了重磅炸弹。本文指出:当算力足够庞大且模型参数足够多时,最好的数据过滤器,就是完全不过滤(NoFilter)。

突破大模型思考极限:最新推理前沿综述拆解两大核心演进路线

当OpenAI的o1模型横空出世,紧接着DeepSeek-R1震撼开源界时。人们敏锐地察觉到,大语言模型不再仅仅是“单句接龙”的文本生成器。它们开始展现出极具深度的长程逻辑推演能力。这种被称为“大模型推理”的核心能力。正成为区分传统聊天机器人与高级人工智能系统的一道巨大分水岭。

拒绝大模型SFT后“千篇一律”:注释锚定训练将语义崩溃降低6倍

毫无疑问,经过监督微调(SupervisedFine-Tuning,SFT)的大语言模型变得更加听话和好用了。它们学会了遵循指令,掌握了安全边界,也习惯了人类喜欢的对话格式。但你是否发现,当你让模型进行创意写作或开放式问答时,它们的回答套路越来越“千篇一律”?