DeepAgent: A General Reasoning Agent with Scalable Toolsets
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具...
本文提出了一个名为 的整体性评估框架,通过跨越三个领域(发散性思维、创意写作、逻辑推理)的九个任务和二十个指标,从质量、新颖性和多样性三个维度系统地评估大型语言模型的创造力。
本文推导出了一个连接Kullback-Leibler散度(KLD)和Jensen-Shannon散度(JSD)的新的、紧致的下界,从而在理论上证明了最大化基于JSD的判别器目标函数等同于最大化互信息(MI)的一个可靠下...
本文通过借鉴认知科学的理性模型,系统性地研究了大型语言模型(LLMs)是否能像人类一样识别和评估沟通背后的动机(即“动机警惕性”),发现它们在受控实验中表现出类似人类的能力,但在复杂的现实世界场景中表现不佳,不过简单的...
本文提出了一种名为“二元检索增强奖励 (Binary Retrieval-Augmented Reward, Binary RAR)”的在线强化学习方法,通过一个简单的二元(事实完全正确为1,否则为0)奖励信号,在不损...
本文通过系统性比较发现,强化学习(RL)在后训练中比监督微调(SFT)更能有效缓解灾难性遗忘,其根本原因在于RL利用在线策略(on-policy)数据所产生的“模式寻求”(mode-seeking)特性,能够在学习新任...
本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显...
本文通过一系列实验发现,大型语言模型(LLMs)的内部激活向量中,确实以线性的方式编码了问题的难度,但这种编码与人类判断的对齐程度远高于与其它LLM性能评估的对齐程度;并且,在强化学习训练过程中,与人类判断一致的难度表...
本文系统性地综述了大型语言模型(LLM)如何重塑知识图谱(KG)构建的全流程,通过分析本体工程、知识抽取和知识融合三个核心阶段的新兴范式,揭示了从传统方法向语言驱动、生成式框架的转变。
本文提出了一种名为稀疏内存微调(sparse memory finetuning)的方法,通过仅更新与新知识高度相关的、利用TF-IDF筛选出的极少数内存槽位,使大型语言模型在学习新知识的同时,显著减少了灾难性遗忘。
本文提出了一种名为 THOUGHTCOMM 的多智能体协作新范式,它使智能体能通过理论上可识别的、直接的潜在“思想”进行交流,而非传统的自然语言,从而突破语言瓶颈,提升集体智能的协作效率和上限。
本文提出了一种名为 Stream 的可解释性框架,通过其具体实现算法 Stream-Attn,利用动态稀疏注意力机制,以近线性的时间( )和线性空间( )复杂度,高效分析大型语言模型在百万级Token长上下文中的注意力...
本文提出 RLEV 方法,通过将可验证的正确性奖励与人类定义的显式价值(如题目分数)相结合,直接优化语言模型,使其不仅追求正确性,更优先处理高价值任务,并学会根据任务重要性调整回答的详略程度。
本文提出了一种名为"Compress to Impress"的高效LLM自适应方法,仅需在100个样本上进行单次梯度计算,并结合多子空间矩阵分解,即可在无需任何微调的情况下,快速提升模型在下游任务上的性能。
本文提出了一种名为 VideoAgentTrek 的可扩展方法,通过一个逆动力学模块(VADM)从未经标注的公开屏幕录制视频中自动挖掘出结构化的训练数据,从而解决了训练计算机使用智能体(Agent)时对大规模手动标注数...
本文提出了一个名为 TheMCPCompany 的大规模工具调用基准(包含超18000个工具),并通过实验证明,利用专门的工具集比通用浏览器能带来更好的性能和更低的成本,但从海量工具中检索并组合正确工具以解决复杂问题仍...
本文通过实验证明,在大型语言模型 (LLM) 的多任务强化学习 (RL) 后训练中,不同任务会产生幅度差异悬殊的梯度,并且大梯度并不意味着大的学习增益,这种梯度不平衡现象会导致优化过程偏向特定任务,从而损害整体性能。
本文通过强化学习训练Transformer执行排序任务,发现更高的嵌入维度能促使智能体形成更可靠、更具可解释性的内部世界模型,即便任务准确率早已饱和。
本文提出了一种新方法,通过利用聊天模板(chat template)作为前缀诱导模型生成内容,并结合神经嵌入(neural embeddings)来度量语义相似度,从而可以从开放权重的语言模型中高效提取出大量有价值的对...
本文提出了一种名为 Ring-linear 的高效混合注意力架构,通过将线性注意力(Linear Attention)与标准的 Softmax 注意力相结合,在显著降低长上下文推理的 I/O 和计算成本的同时,保持了强...
本文提出了一个可量化的框架来定义和衡量通用人工智能(AGI),即将其定义为在认知通用性(versatility)和熟练度(proficiency)上与受过良好教育的成年人相匹配的系统,并通过借鉴人类心理测量学中的CH-...
好的,我已判断这是一篇 [综述] 论文。我将严格遵循综述报告的模板,以原文结构为基础,重点剖析其提出的分类体系,并提炼核心内容。
本文提出了一种名为深度自进化推理(Deep Self-Evolving Reasoning, DSER)的概率框架,它将迭代推理建模为马尔可夫链,使即使是能力较弱的模型也能通过长时间的并行自进化过程,解决原本无法解决的...
本文提出了一种名为 Auto-Rubric 的无训练框架,通过一个两阶段(查询特定的准则生成与查询无关的准则聚合)过程,仅用极少量偏好数据即可自动提取出可解释、可泛化且高效的奖励模型评估准则(Rubric)集。