推理 第5页

微软最新证据:Transformer并非层数闲置,而是按难度自适应!

近年来,大语言模型的能力随着参数规模和网络深度的增加而显著跃升。直觉上,层数越深,模型能够处理的逻辑越复杂。然而,近期学术界却出现了一种截然相反的声音:有研究通过对残差流的分析指出,Transformer模型后半部分的层对最终输出的贡献微乎其微,甚至砍掉后面的层也不会对结果产生致命影响。

自动搜索奖励函数!单卡40小时跑通GRPO闭环,模型F1提升0.19

最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training)阶段不仅能让模型学会说话,还能让模型学会思考。

Harvard与MIT提出BES:双向进化机制攻克3大推理基准

在当今的大型语言模型和智能体系统研究中,如何让模型在复杂推理任务上表现得更好,已成为核心议题。无论是通过后训练(Post-training)让模型自我改进,还是在推理阶段(Inference)通过增加计算量来拉升性能上限,依赖的核心机制往往都是“搜索”。

中科院提出CLSR:让大模型自创符号语言,推理Token缩减3-6倍

大型语言模型(LLMs)在处理复杂推理任务时,往往依赖于思维链(Chain-of-Thought,CoT)技术。通过让模型一步一步地用自然语言写出推理过程,其准确率确实得到了显著提升。然而,这里隐藏着一个根本性的效率错位:人类用来沟通和理解的自然语言,对于机器的内部逻辑推理而言,真的是最经济、...

半数算力提升4.8分!GRADE:四大门控重构自适应多智能体推理

大模型推理能力的发展,正逐渐从依赖单体模型参数的线性增长,转向多智能体(Multi-agent)协作机制。然而,简单地堆叠多个智能体往往会带来推理延迟与显存占用的成倍增加,更关键的是,过去的研究并未彻底解决三个核心问题:遇到具体查询时究竟该唤醒哪些智能体?查询信息需要在智能体层级中下探到多深?

打破大模型推理天花板:DSRL双空间强化学习,反思能力暴涨14倍

以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。

告别被动检索!NapMem多粒度记忆金字塔让大模型学会主动导航

当你和一个AI助手交流了数月甚至数年,你期望它能建立起对你的深度理解。然而,当前大多数基于大型语言模型(LargeLanguageModel,LLM)的长期记忆系统,依然依赖于被动的检索接口——即系统在后台悄悄检索几段文本,然后塞进模型的上下文中。

告别手搓Agent!HarnessX实现大模型与运行时外挂协同进化,性能最高飙升44%

目前开发AIAgent,最痛苦的环节莫过于“手搓”外挂代码。换个新模型,提示词模板可能得全部重写。加个新工具,原本顺畅的控制流直接崩溃。大量在运行中产生的报错记录和轨迹,最后只能被当成垃圾数据扔掉。究竟有没有一种方法,能让Agent的运行框架自己学习、自己修改代码?

Kimi-VL技术解密:28亿激活参数跑通128K长窗口与多模态慢思考

大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型()在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考()的能力。为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了Kimi-...

MEMENTO:大模型学会自主管理上下文,KV缓存直降2.5倍!

当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...

揭秘大模型SFT数据陷阱:破解步长混杂,ASLEC提点超9%

随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?

PEEK:为大模型Agent装上“上下文地图”,长文本成本直降5.8倍

当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索...

ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%

最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。

告别“一次性”Agent!SkillOS重塑技能管理,性能跃升近10%

当前的大模型智能体(Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。

大模型也会“聊崩”?多智能体谈判实验揭秘4大协作陷阱

当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困难的单体推理测试,却在简单的多轮团队沟通中频频翻车?