最新发布
CLAUDE.md暴增226%:灾难性记忆让指令不敢删,注释来破局
几乎每一个在生产环境中使用过智能编程助手(如ClaudeCode、Cursor或GitHubCopilot)的工程师,都遭遇过一个微妙而普遍的治理噩梦:代码仓库根目录下的CLAUDE.md、AGENTS.md或是.github/copilot-instructions.md,随着项目迭代总是在不可遏制地变长。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
几乎每一个在生产环境中使用过智能编程助手(如ClaudeCode、Cursor或GitHubCopilot)的工程师,都遭遇过一个微妙而普遍的治理噩梦:代码仓库根目录下的CLAUDE.md、AGENTS.md或是.github/copilot-instructions.md,随着项目迭代总是在不可遏制地变长。
PAPER INSIGHTS
大语言模型(LLM)正迅速从“单轮对话的文本生成器”迈向“多轮自主行动的智能体(Agent)”。在浏览网页(WebArena)、操控操作系统(OSWorld)或执行复杂代码任务时,模型需要不断输出动作指令、调用工具或系...
在大模型推理成本高居不下的背景下,模型路由(LLMRouting)被普遍视为最直接的降本增效利器。它的逻辑非常直观:遇到简单问题交给廉价的小模型,遇到复杂推理才激活昂贵的大模型。
大模型解决一道给定的数学竞赛题或验证一个形式化命题,已经屡见不鲜。从Putnam竞赛基准到各类形式化证明系统,AI的推理能力在快速逼近人类顶尖水平。然而,在真正的数学前沿研究中,这种“人出题、AI做题、人复核”的单题交...
长期以来,在利用大语言模型(LLM)优化系统提示词(Prompt)、演进复杂算法代码或微调机器学习(ML)训练流程时,学术界和工业界普遍采用同一种范式:外挂一套显式的数学优化或搜索算法。
在具身智能、机器人规划和多模态助手的技术演进中,空间智能(SpatialIntelligence)正被视为大模型迈向物理世界的核心基石。然而,即便是当前顶尖的视觉语言模型(VLM),在面对三维空间关系推理、遮挡判断、坐...
在构建自主智能体(AutonomousAgent)时,业界几乎默认遵循一种“对话式上下文累积”的运行范式:智能体每执行一步,就把环境观察、思考链(CoT)、工具调用参数和执行返回值,线性追加到上下文末尾。只要执行步骤变...
大语言模型(LLM)驱动的搜索智能体(SearchAgent)正从简单的单轮关键词检索,演进为需要多轮规划、长程探索与交叉验证的深度推理系统。然而,训练一个真正可用的长程搜索智能体始终面临结构性困难:现实中极度缺乏高质...
长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动...
在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(ReasoningPremium):模型的输出To...
在多轮交互任务中训练大语言模型(LLM)智能体,强化学习(RL)正在成为不可替代的核心范式。从DeepSeek-R1走红以来,组相对策略优化(GroupRelativePolicyOptimization,简称GRPO...
将大规模视频生成模型转化为机器人的“世界模型”,是具身智能领域最具吸引力的探索方向之一。预训练视频模型在海量真实世界视频中学习到了极其深厚的物理先验:物体如何移动、刚体与流体如何形变、接触碰撞发生时场景如何反馈。
要让大语言模型(LLM)从只会单轮对话的聊天机器人,蜕变为能长期伴随用户的智能体,外部记忆系统不可或缺。然而,当前主流智能体记忆系统的运行逻辑存在一个隐形却极其昂贵的代价:每产生一轮对话,系统就急于调用一次LLM去抽取...
在肺癌精准医疗的实际诊疗中,病理评估早已超越单纯的“看切片定良恶性”。临床医生制定靶向治疗、免疫治疗或抗体偶联药物(ADC)方案,必须依赖组织形态学(H&E)、免疫组织化学(IHC)多标志物以及分子变异数据的深度整合。
在软件工程智能体(CodingAgent)的演进过程中,从业者的交互模式正在发生一场深刻的范式转移。过去,开发者习惯于紧盯智能体的每一步输出,手工审查终端报错,并不断微调输入提示词。
当开发者把一个具有广泛权限的系统凭据(Credential)交给自主运行的大语言模型Agent时,一个根本性的安全隐患就此埋下:Agent继承了人类在系统里的访问触达范围,却没有继承人类在具体场景中运用权限的审慎判断。
评估一个大语言模型或智能体(Agent)的科学能力,标准正在发生根本性的变化。过去两年,各类基准测试主要集中于两类形态:要么是类似于“人类最后考试”(HLE)这种高度凝练、依赖纯专家知识的硬核选择题与问答题,要么是针对...
在复杂的信息检索与深度推理任务中,基于大语言模型(LLM)构建的深度搜索智能体(DeepResearchAgents)正在展现出惊人的自主规划能力。然而,许多工程师和研究人员在实测中都会遭遇一个令人沮丧的现象:当智能体...
在具身智能与通用机器人操作领域,世界-动作模型(World-ActionModels,简称WAM)正在成为一种极具竞争力的新范式。相比于传统的视觉-语言-动作模型(VLA),WAM的核心优势在于“通过预测未来以更好地执...
大模型编程智能体(CodingAgent)正在经历从“单次工具调用”向“自演化系统”的重要跃迁。像Voyager、MetaGPT等经典框架,以及兼容ModelContextProtocol(MCP)等工具生态的现代Ag...
在大语言模型被赋予工具调用、代码执行和环境反馈能力之后,基于可验证奖励的强化学习(RLVR,ReinforcementLearningwithVerifiableReward)已经成为训练代码Agent(CodingA...
在处理长程、多轮的复杂智能体(Agent)任务时,大语言模型常常陷入一种两难困境:如果将每一次工具交互、网页浏览和中间思考都完整保留在提示词中,上下文长度会以惊人的速度膨胀。