WebGrader:可执行评测自进化,8B模型网页生成逆袭480B巨兽
来自北京理工大学、北京交通大学和中国人民大学的研究团队提出了 WebGrader ,针对上述痛点提供了一种全新解法:他们将开放式网页生成的强化学习表述为一个 可执行奖励构建(Executable Reward Construction) 问题。
来自北京理工大学、北京交通大学和中国人民大学的研究团队提出了 WebGrader ,针对上述痛点提供了一种全新解法:他们将开放式网页生成的强化学习表述为一个 可执行奖励构建(Executable Reward Construction) 问题。
针对这一瓶颈,来自卡内基梅隆大学(Carnegie Mellon University, CMU)的研究团队提出了一种更加逼近全自主进化的新范式—— 极简数据自适应(Minimal-Data Adaptation, MDA) 。
中关村学院等机构提出的 World Tokens 给出了一条极具启发性的破解思路: 将世界模型完全限制在训练阶段,推理部署时彻底剥离 。该方案既保留了世界模型带来的物理时空演进监督,又让在线推理维持在毫秒级的纯 VLA 延迟水平。
针对这一问题,来自香港科技大学、IDEA 研究院和 DataArcTech 的联合团队提出了 Envs-FORGE 。该研究放弃了静态的 Prompt 模板,转而将环境合成形式化为一个由验证器奖励驱动的 动作决策问题 。
- 状态构建(State Construction) :在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
LinkedIn 建立了一套高度解耦的模块化评估框架,将客服交互质量拆解为互不干扰的独立维度,并分别设计评估策略: - 接地性与事实依据(Groundedness) :专门校验 Agent 生成的每一条事实性断言是否严格由检索到的文档支撑,一旦出现文档未提及的技术细节或操作指引,直接判定为幻觉。
自AlexNet掀起现代深度学习的浪潮以来,AI领域建立了一条近乎公理的演进路径:端到端(end-to-end)训练总能击败手工切分的分阶段流水线。从早期的图像分类、物体检测,到语义分割与端到端语音识别,凡是允许模型直接从数据中学习完整映射的任务,其性能和泛化边界都得到了质的飞跃。
长期以来,人工智能领域对“递归自提升”(RecursiveSelf-Improvement,RSI)的讨论往往停留在理论推演或科幻设想中。如果一个智能系统能够自主改进制造下一代AI的过程,智能的爆发式增长就会成为可能。
当前的自动化科学发现正在向“第五范式”迈进,即依赖自动驾驶实验室(Self-drivinglaboratories,SDLs)通过机器人实现高通量实验。然而,在这个看似前沿的领域中,存在一个极为底层的痛点:绝大多数湿实验智能体仍停留在“无记忆”的静态执行阶段。
在大语言模型(LLM)的后训练阶段,基于强化学习(RL)的对齐技术已经取得了显著的成果。无论是在数学推理、工具调用还是代码生成等单轮交互任务中,标准的“生成-验证-更新”循环都展现出了极高的效率。
在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者的多样化反馈,并逐渐承担更大的独立决策权。
当整个行业都在试图通过堆叠激光雷达、深度相机全景阵列甚至预先构建的高精地图来提升机器人的导航成功率时,Mistral团队给出了一个截然不同的答案。他们带来的最新成果RobostralNavigate,不仅是一个拥有80亿参数的视觉语言模型(VLM),更代表了一种极简、高泛化性的具身智能扩展路线。
科学研究的基石在于可复现性。一个好的科学解释应当能够经受住反复的验证:在相同的实验条件下,应当能得出相同的结果。然而,当代科学特别是机器学习领域,正面临着严峻的“复现危机”。理论上,基于大语言模型(LLM)的智能体有潜力成为解决这一危机的可扩展方案,但在实践中,让AI独立完成论文复现一直是个未...
让大模型从一个只会聊天的文本生成器,转变为能够解决实际问题的智能体(Agent),其核心跨越在于赋予模型调用外部工具的能力。不论是查询实时搜索引擎、运行Python脚本,还是发送邮件、执行SQL数据库操作,决定“在什么时候使用工具”不仅是智能体认知能力的核心体现,更是工业界落地时必须精打细算的...
计算机使用智能体(Computer-UseAgents)的发展正面临一个残酷的物理屏障:它们无法在真实世界中自由地试错。一个智能体只有在它的行为产生实际后果时,才能真正学到东西。一次点击改变了保存的状态,一条信息送达了真人,或者一个拒绝跳转的页面告诉智能体“你刚才的操作无效”——这些都是宝贵的反馈。
在短上下文和干净的演示数据上,现有的大语言模型网页智能体(BrowserAgent)已经展现出令人惊艳的性能。然而,当这些智能体真正被部署到现实世界的动态网页中时,它们的表现往往会遭遇滑铁卢。
大型语言模型的落地部署正经历一场从追求极度规模到追求极致效率的范式转移。在这个过程中,低秩自适应(Low-RankAdaptation,即LoRA)凭借其极小的训练开销,几乎成为了参数高效微调(Parameter-EfficientFine-Tuning)的行业基石。
在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规则反馈优化指令遵循能力,针对单一领域的强化学习管道往往能够稳定且大幅度地提升...
在深度学习尤其是大语言模型的训练中,优化器的设计直接决定了模型学习的效率与最终的性能上限。长期以来,AdamW等基于标量动量和方差调整的优化器占据了主导地位。然而,随着模型规模的爆炸式增长,研究人员开始将目光投向利用权重和梯度矩阵结构的二阶或伪二阶优化器。
大型语言模型在规划、工具调用和环境交互等复杂任务中,正越来越多地被部署为自主智能体(Agent)。为了让模型在多轮交互中表现更佳,在线策略蒸馏(On-PolicyDistillation,简称OPD)成为了一种极具前景的训练框架。
在基于大语言模型(LLM)的复杂应用前沿,多智能体系统正在成为解决跨领域复杂任务的核心范式。通过将不同的职责分配给具备专门设定的智能体,系统能够实现更丰富的推理、更灵活的规划以及跨越多个工具的协调工作流。
长期以来,大语言模型预训练的数据清洗被视作不可逾越的金科玉律。业界普遍认为,必须将海量网页数据精心过滤,剔除低质量内容,才能喂给模型。然而,斯坦福大学的一项最新研究,向这一常识投下了重磅炸弹。本文指出:当算力足够庞大且模型参数足够多时,最好的数据过滤器,就是完全不过滤(NoFilter)。
当OpenAI的o1模型横空出世,紧接着DeepSeek-R1震撼开源界时。人们敏锐地察觉到,大语言模型不再仅仅是“单句接龙”的文本生成器。它们开始展现出极具深度的长程逻辑推演能力。这种被称为“大模型推理”的核心能力。正成为区分传统聊天机器人与高级人工智能系统的一道巨大分水岭。
毫无疑问,经过监督微调(SupervisedFine-Tuning,SFT)的大语言模型变得更加听话和好用了。它们学会了遵循指令,掌握了安全边界,也习惯了人类喜欢的对话格式。但你是否发现,当你让模型进行创意写作或开放式问答时,它们的回答套路越来越“千篇一律”?