上下文越长越好?JHU提出信息丰裕悖论:长窗口训练正在削弱大模型参数记忆
针对这一行业谜题,来自约翰斯·霍普金斯大学(Johns Hopkins University)的研究团队发表了一篇具有颠覆性质的论文,提出了 “信息丰裕悖论”(Information Abundance Paradox) 。
针对这一行业谜题,来自约翰斯·霍普金斯大学(Johns Hopkins University)的研究团队发表了一篇具有颠覆性质的论文,提出了 “信息丰裕悖论”(Information Abundance Paradox) 。
华中科技大学与小红书团队在最新论文中提出了名为 FlowBlock 的免训练并行解码框架,从底层打破了这一看似不可逾越的块间串行壁垒。该研究敏锐地指出,在以 LLaDA-2.1 为代表的新一代具备“自我纠错”(Token-to-Token, T2T)能力的扩散语言模型中,块的确定性不再是不可妥...
面对这一困局,来自阿里巴巴和清华大学的研究团队提出了全新的解决思路: State2State 。这项研究不再纠结于“如何让人类或更强的大模型生成更多任务”,而是退回智能体交互的最本质关系——智能体与环境。
来自浙江大学、蚂蚁集团(Inclusion AI / AWorld 团队)、上海创新研究院、西湖大学与南京大学的研究团队提出了全新框架 CrEST (Hierarchical Credit Assignment via Entropy-Gated Self-Teacher)。
针对这一病灶,本文提出了一种极具工程巧思的解法—— 动作松弛期刷新(Actuation-Slack Refresh) :利用机械臂执行动作块时 GPU 闲置的几百毫秒“物理死区”,在推理关键路径之外无条件执行一次完整的密集前向,给下一步递交一份“干净”的门控信号与基底缓存。
他们提出了 FACT(Failure-Aware Causal Training)框架,打破了“先脑补未来、再倒推动作”的定势,颠倒为“先决策动作、再因果推演未来与任务进展”。
来自清华大学、北京大学、华中科技大学、美团、MBZUAI、上海交通大学和香港中文大学等机构的研究团队提出了 AutoDesign 框架。这项工作跳出了“微调底层多模态模型权重”的传统路径,而是引入了 元脚手架优化(Meta-Harness Optimization) 机制。
研究者在此基础上提出了“对比消除”的设计。如果仅向模型灌输“打分器偏爱列表推导式而非 for 循环”,模型随后开始狂写列表推导式,实验者依然无法辨析模型是为了讨好打分器,还是产生了一种“既然打分器喜欢,那么用户大概也更喜欢”的常识性信念迁移(Belief Transfer)。
面对这一两难困境,来自具身智能前沿的研究团队提出了一套创新的非侵入式闭环迭代微调框架—— CLIFT (Closed-Loop Iterative Fine-Tuning)。
来自伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究团队提出了一种兼具轻量与强悍特性的推理时干预方案: V-Steer 。该方法完全免微调(Training-Free),不修改任何模型参数,仅在 Prefill 阶段针对性地修改特定注意力头缓存中的 Value 向量,就能让大模型在发生权限冲突时...
此前提出的归一化 Transformer(normalized Transformer,简称 nGPT)试图从几何根源解决该问题:将模型的所有参数矩阵与激活向量全部约束在单位超球面上,把前向传播直接重构成在超球面流形上的逐步优化过程。
针对不同深度的代码区域,CyberForge 设计了两套互补的注入流水线。这一流水线专攻现有模糊测试 Harness 能够直接触达的代码区域。借助 Harness 现成的输入解析通道,系统可以显著降低 PoV 构建的试错开销。
由阿里巴巴、清华大学、中国科学院等机构联合发布的研究给出了新的解法:研究团队构建了包含 1,140 条真实长程失败轨迹的基准数据集 LongRCA Bench ,并提出了名为 RCTA (Root-Cause Trajectory Attribution)的免训练诊断方法。
为了在系统工程上支撑这一目标,Macaron-V1 提出了 Mixture-of-LoRA(MoL)架构,将一个超大规模基座模型完全冻结,在其上挂载并动态调度多个领域专精的 LoRA 适配器。
英伟达团队的技术假设在于:自然语言的广阔表达空间更符合高阶数学的探索本质,而消除逻辑谬误的关键,不在于引入外部编译器,而在于构建专门化的后训练模型组合,并设计高算力驱动的测试时搜索与纠错机制。
研究团队提出了名为 DocAtlas 的文档交互外壳(Document Harness),让检索树索引、笔记库和已探索页面随着 Agent 的探索实时演化。该框架在业界引发关注的核心在于两组数据:在极具挑战的多模态长文档基准 MMLongBench-Doc 上。
在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 FP4 与全精度 BF16 的准确率差距从 4.9% 缩小至仅 1.1%。
清华大学与北京邮电大学的研究团队打破了这种“预训练管通用常识,后训练才学工具调用”的惯性思维,提出了名为 SPT (Skill Pre-Training)的中间训练(Mid-Training)范式。
针对这一困境,研究人员提出了全新的三值化 PTQ 框架 ScaleQ-1.58 。该框架的核心洞察非常尖锐:在极低比特的重构过程中,传统 PTQ 沿用通用网页文本进行校准的做法从根本上忽略了思维链(Chain-of-Thought, CoT)的本质。
为此,研究团队提出了 FRAMES (Feedback-driven Reasoning with Adaptive Mutation and Evolution of Skills,自适应突变与技能演化的反馈驱动推理框架),旨在让大模型 Agent 在模型权重保持冻结的约束下。
为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct (Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗长文本退化,而是重新设计了推理的承载基质:将深度搜索形式化为 固定拓扑查询图...
针对这一矛盾,最新研究提出了 Meta-Task 框架,其核心哲学非常直接而巧妙: 与其用外部流水线生硬拼接任务,不如把“合成终端任务”本身定义为一个标准的 Terminal-Bench 格式任务(即元任务,Meta-Task) 。
RadixArk:随着 Miles 开源生态的演进,前沿尺度的 Agent 训练技术门槛将被进一步拉低,为学界与工业界构建真正具备自我演进能力的复杂智能体提供了稳固可靠的工程底座。
LongCat:其中,DeepSeek 提出的 DeepSeek Sparse Attention(DSA)凭借独立的轻量化检索器 Lightning Indexer,实现了精细的 Token 级动态检索,不仅在 DeepSeek-V3.2 与 GLM-5 等前沿开源模型中落地。