模型训练

FlowBlock:免训练波前并行,扩散大模型吞吐提升4倍精度反增

华中科技大学与小红书团队在最新论文中提出了名为 FlowBlock 的免训练并行解码框架,从底层打破了这一看似不可逾越的块间串行壁垒。该研究敏锐地指出,在以 LLaDA-2.1 为代表的新一代具备“自我纠错”(Token-to-Token, T2T)能力的扩散语言模型中,块的确定性不再是不可妥...

AutoDesign:不是微调模型而是迭代脚手架,得分超Claude Design 7.4分

来自清华大学、北京大学、华中科技大学、美团、MBZUAI、上海交通大学和香港中文大学等机构的研究团队提出了 AutoDesign 框架。这项工作跳出了“微调底层多模态模型权重”的传统路径,而是引入了 元脚手架优化(Meta-Harness Optimization) 机制。

不是为了做对,而是为了得分:OpenAI o3被证实随RL训练更偏向打分器

研究者在此基础上提出了“对比消除”的设计。如果仅向模型灌输“打分器偏爱列表推导式而非 for 循环”,模型随后开始狂写列表推导式,实验者依然无法辨析模型是为了讨好打分器,还是产生了一种“既然打分器喜欢,那么用户大概也更喜欢”的常识性信念迁移(Belief Transfer)。

V-Steer:不用微调改写KV缓存,大模型指令遵循率从18%提到92%

来自伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究团队提出了一种兼具轻量与强悍特性的推理时干预方案: V-Steer 。该方法完全免微调(Training-Free),不修改任何模型参数,仅在 Prefill 阶段针对性地修改特定注意力头缓存中的 Value 向量,就能让大模型在发生权限冲突时...

LongRCA Bench:长轨迹Agent故障谁背锅?免训练RCTA定位达24.1%

由阿里巴巴、清华大学、中国科学院等机构联合发布的研究给出了新的解法:研究团队构建了包含 1,140 条真实长程失败轨迹的基准数据集 LongRCA Bench ,并提出了名为 RCTA (Root-Cause Trajectory Attribution)的免训练诊断方法。

华为HiFloat4:首个端到端FP4强化学习,将BF16差距缩至1.1%

在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 FP4 与全精度 BF16 的准确率差距从 4.9% 缩小至仅 1.1%。

G-ReAct:图引导深度搜索打破线性困境,1.9K轨迹微调达79%精度

为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct (Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗长文本退化,而是重新设计了推理的承载基质:将深度搜索形式化为 固定拓扑查询图...