-
AgentInit: Initializing LLM-based Multi-Agent Systems via Diversity and Expertise Orchestration for Effective and Efficient Collaboration
本文提出了一种名为 AgentInit 的多智能体系统(Multi-Agent System, MAS)初始化方法,该方法通过生成一组多样化的候选智能体,并利用以任务相关性和团队多样性为目标的帕累托最优原则进行团队选择,来优化智能体团队的构成,从而提升协作效率与任务表现。
-
Agentic Software Engineering: Foundational Pillars and a Research Roadmap
结构化智能体软件工程(SASE):基本支柱与研究路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Agentic Meta-Orchestrator for Multi-task Copilots
本文提出了一种名为“智能体元编排器” (Agentic Meta-Orchestrator, AMO) 的新架构,用于构建可扩展的多任务Copilot服务,该架构通过学习排序模型进行智能体路由,利用LoRA臂实现高效多任务推理,并通过元学习决策树来动态规划推理路径。
-
Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
Agentic Memory:让LLM像人类一样“自主管理”记忆,长程推理能力暴涨49%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Agentic Inequality
本文提出并探讨了“智能体不平等”(agentic inequality)这一新概念,即因AI智能体的接入和能力差异而导致的权力、机会与结果上的不平等,并构建了一个包含可用性、质量和数量三个维度的分析框架,以系统性地分析和应对这一挑战。
-
Agentic AI: A Comprehensive Survey of Architectures, Applications, and Future Directions
本文对智能体AI(Agentic AI)领域进行了全面的综述,提出了一个核心的分析框架以解决现有文献中的概念混乱。作者认为,当前的智能体AI系统并非单一演化的产物,而是源于两个截然不同但有时会交汇的谱系:符号/经典谱系(Symbolic/Classical lineage)和神经/生成谱系(Neural/G。
-
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
本文提出了一个名为 AgentGym-RL 的强化学习框架和一个名为 ScalingInter-RL 的渐进式训练方法,旨在通过多轮交互式决策,从零开始(无需监督微调)训练大型语言模型(LLM)智能体,以解决长时程复杂任务。
-
AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
本文提出了 AgentFrontier,一个基于教育心理学“最近发展区”(ZPD)理论的数据合成框架,通过自动生成位于大语言模型(LLM)能力边界上的复杂推理数据,从而系统性地提升智能体(Agent)的跨领域、综合推理能力。
-
AgentFold: Long-Horizon Web Agents with Proactive Context Management
本文提出了一种名为 AgentFold 的新型网页智能体,它通过模仿人类主动管理心智暂存区的方式,在执行长时程任务时对上下文进行主动“折叠”和整合,从而在保持上下文简洁性的同时避免关键信息丢失,并以较小的模型规模实现了顶尖的性能。
-
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
零数据也能自我进化:Agent0让8B模型推理能力暴涨24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
本文提出了一种名为智能体数据协议 (Agent Data Protocol, ADP) 的轻量级表示语言,它通过将来自不同来源、格式各异的智能体训练数据统一为标准模式,解决了数据碎片化问题,从而实现了对大型语言模型智能体进行大规模、多样化且高效的监督式微调。
-
Adaptation of Agentic AI
13所顶尖名校联手:Agentic AI 适配的 4 大核心范式与未来路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
AdamHD: Decoupled Huber Decay Regularization for Language Model Pre-Training
AdamW的继任者?AdamHD让LLM训练提速15%,性能提升4.7%,显存再省30%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Action Language BC+
本文提出了一种名为 BC+ 的新动作语言,通过将其语义建立在通用的稳定模型(Stable Model)之上,成功地统一并扩展了多种现有动作语言(如 , , , ),并自然地集成了现代答案集规划(Answer Set Programming, ASP)中的高级构造(如选择规则和聚合)。
-
ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking
AI标注成本直降90%!字节ACT框架:让大模型学会「批判性思维」。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Accurate Table Question Answering with Accessible LLMs
Qwen-14B逼近GPT-4!Orchestra多智能体架构让开源模型制霸表格问答。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Accelerate Speculative Decoding with Sparse Computation in Verification
打破投机采样瓶颈:美团提出“稀疏验证”框架,Attention与MoE全面瘦身。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Systematic Survey on Large Language Models for Evolutionary Optimization: From Modeling to Solving
优化技术已成为解决工程设计、经济规划和科学发现等领域复杂问题的关键。实践中,优化算法分为精确方法和近似方法,但没有任何一种算法能普适于所有问题(“没有免费的午餐”定理),这使得算法的选择、配置和设计高度依赖专家知识。机器学习,特别是强化学习(RL),虽被用于降低这种复杂性,但其泛化能力有限。
-
A Systematic Study of Model Merging Techniques in Large Language Models
大模型融合实测:6种先进方法惨败,竟不敌最简单的“加减法”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey on Parallel Reasoning
现代大型语言模型 (Large Language Models, LLMs) 通过扩展参数和训练数据,获得了强大的基础能力。随后的研究探索了推理时扩展,如扩展思维链 (Chain-of-Thought, CoT),显著提升了推理性能。在此基础上,本文探讨了一种正交的方法:并行推理 (Parallel Rea。
-
A Survey on Multimodal Large Language Models
近年来,大型语言模型 (Large Language Models, LLMs) 取得了显著进展,通过扩大数据和模型规模,展现出指令遵循 (instruction following)、上下文学习 (In-Context Learning, ICL) 和思维链 (Chain of Thought, CoT)。
-
A Survey on LLM Mid-training
当代大型语言模型 (LLM) 的开发已从单一的预训练模式演变为复杂的多阶段优化框架。预训练通过接触大规模多样化语料库为模型奠定基础能力,而后续的优化阶段则系统性地增强特定能力。中间训练 (mid-training) 作为连接预训练和后训练的关键桥梁,其重要性日益凸显。
-
A Survey on LLM-as-a-Judge
在众多领域,准确和一致的评估对决策至关重要,但由于固有的主观性、可变性和规模问题,这仍然是一项艰巨的任务。传统评估方法面临一个两难困境:以专家驱动为代表的主观方法虽然全面,但成本高、难扩展且一致性差;而以自动度量(如BLEU、ROUGE)为代表的客观方法虽然可扩展性与一致性强,但往往只关注表面词汇重叠,无法。
-
A Survey on Large Language Model (LLM) Security and Privacy: The Good, the Bad, and the Ugly
大型语言模型(LLM)安全与隐私综述:善、恶与丑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey on Large Language Model based Autonomous Agents
LLM Agent全面爆发:人大重磅综述,一套统一架构读懂通往AGI的未来。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey on Evaluation of Large Language Models
A Survey on Evaluation of Large Language Models。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey on Efficient Large Language Model Training: From Data-centric Perspectives
大型语言模型 (Large Language Models, LLMs) 的后训练 (post-training) 已成为释放其领域适应能力和任务泛化潜力的关键阶段。这一阶段有效增强了模型在长上下文推理、人类对齐、指令微调和领域专用适应等方面的能力。
-
A Survey on Agentic Multimodal Large Language Models
关于Agentic多模态大语言模型的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Weight Space Learning: Understanding, Representation, and Generation
模型即数据!英伟达领衔,三大维度解读AI新前沿:权重空间学习。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Vibe Coding with Large Language Models
关于使用大型语言模型进行 Vibe Coding 的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Reinforcement Learning for Large Reasoning Models
对用于大型推理模型的强化学习的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms
自动驾驶的“认知”革命:大模型如何攻克7大核心推理挑战?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models
时间序列数据在金融、医疗、能源等领域无处不在,推动了监控、预测和决策等关键应用的发展。然而,许多新兴应用如个性化医疗、自适应风险管理等,要求模型不仅能预测,还能解释其输出、进行因果推理和决策。这突显了时间序列分析对结构化和可靠推理能力的迫切需求。
-
A Survey of Large Language Models
A Survey of Large Language Models。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Inductive Reasoning for Large Language Models
本节介绍归纳推理的相关概念、应用场景及其重要性。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Survey of Data Agents: Emerging Paradigm or Overstated Hype?
随着大型语言模型 (Large Language Models, LLMs) 的兴起,一种新的范式——数据智能体 (Data Agents)——应运而生。数据智能体被定义为一个综合性的、由LLM驱动的架构,它能自主协调数据与AI生态系统,以处理复杂的数据相关任务。
-
A Survey of AI Scientists: Surveying the automatic Scientists and Research
本文首次对新兴的 AI 科学家 (AI Scientist) 领域进行了系统性综述,提出了一个统一的六阶段科学工作流框架,并基于此框架梳理了从 2022 年到 2025 年的关键研究,揭示了该领域从基础模块化、闭环集成到追求可扩展性、影响力与人机协作的清晰三阶段演进脉络。
-
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
成功率飙升6倍超GPT-4o!DeepMind发布MiRA,用“里程碑”根治AI智能体“迷路”顽疾。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT
软件模式与提示模式的比较。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
本文通过将多轮智能体强化学习(multi-turn agentic reinforcement learning)的设计空间分解为环境、奖励和策略三大支柱,系统性地进行了实证研究,并最终提炼出一套用于训练大型语言模型(LLM)智能体的实用方法配方。
-
A Novel Combined Data-Driven Approach for Electricity Theft Detection
本文提出了一种结合最大信息系数(MIC)和快速搜索密度峰值聚类(CFSFDP)的数据驱动方法,以无监督的方式,仅需少量额外信息(区域总电表数据),即可高效、准确地检测出形态各异的电力盗窃行为。
-
A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity
本文提出了一个全面的评估框架,对ChatGPT在多任务、多语言、多模态、推理、幻觉和交互性方面进行了系统的量化评估,揭示了其在多数零样本任务上的卓越表现,同时也指出了其在低资源语言、复杂推理和事实性方面的显著局限。
-
A Multiobjective Reinforcement Learning Framework for Microgrid Energy Management
本文提出了一个结合多目标进化算法与强化学习的新颖框架,用于解决微电网 (Microgrid, MG) 能源管理中的多目标优化问题,实现了在处理成本、排放和热能浪费等冲突目标时的性能提升和策略可解释性。
-
A model of errors in transformers
DeepMind重磅:仅需2个参数,精准预测LLM错误率!物理学“有效场论”立大功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A General Theoretical Paradigm to Understand Learning from Human Preferences
本文提出了一个名为 Ψ-偏好优化 (ΨPO) 的通用理论框架,该框架统一了现有的从人类偏好中学习的方法(如 RLHF 和 DPO),并在此基础上提出了一种名为 IPO 的新方法,它通过直接优化成对偏好而非依赖 Bradley-Terry 模型,有效解决了 DPO 在面对确定性或稀疏偏好数据时容易出现的过拟合。
-
A Definition of AGI
本文提出了一个可量化的框架来定义和衡量通用人工智能(AGI),即将其定义为在认知通用性(versatility)和熟练度(proficiency)上与受过良好教育的成年人相匹配的系统,并通过借鉴人类心理测量学中的CH-C认知能力理论,将通用智能分解为十个核心认知域进行评估。
-
A Concise Review of Hallucinations in LLMs and their Mitigation
终结AI幻觉:全面剖析大模型“胡说八道”的根源与应对策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Comprehensive Survey on World Models for Embodied AI
面向具身智能的世界模型综合综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Comprehensive Dataset for Human vs. AI Generated Text Detection
本文发布了一个包含超过58000条文本的大型数据集,其中包含真实的《纽约时报》文章以及由六种先进大语言模型(LLMs)生成的对应版本,并为区分人类与AI文本以及AI文本模型溯源这两个任务提供了基准性能。
-
A Component-Based Survey of Interactions between Large Language Models and Multi-Armed Bandits
LLM遇上多臂老虎机:首篇组件级综述揭秘“双向增强”决策智能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。