An Information Theoretic Perspective on Agentic System Design
斯坦福Agent新解:3B模型压缩上下文,99%性能仅需26%成本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斯坦福Agent新解:3B模型压缩上下文,99%性能仅需26%成本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent的“金鱼记忆”:EvoClaw揭示其长期编码性能从80%暴跌至38%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解Agent“不可能三角”:EvoRoute实现成本降80%、速度提升3倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给 AI 装上“橡皮擦”:MaRS 架构如何用“遗忘”换取 0.911 的高分表现?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GoAgent:让AI Agent学会“抱团”,准确率93.8%,Token成本降低17%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至91%!Hindsight:让20B模型记忆力超越GPT-4o。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里开源ROME:SWE-bench胜率57%,揭秘打造顶尖Agent的“罗马”基建。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给大模型配台“电脑”:通用智能涌现,长文本Token消耗暴降8倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
超越Gemini!阿里MAI-UI发布:全尺寸GUI Agent与端云协同新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让Agent自己“进化”大脑?MemEvolve实现17%性能跃升与跨模型泛化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别AI“健忘症”:Memoria利用加权知识图谱打造可扩展的个性化记忆。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent记忆≠RAG!复旦/NUS重磅综述:3大维度全景拆解智能体“大脑”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别微调!MemRL:用“记忆RL”让Agent在运行时实现自我进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MetaClaw:AI Agent的在职进化论,准确率从21.4%飙升至40.6%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GPT-5也排0%分位?ReX-MLE揭秘:顶尖AI智能体为何搞不定医学影像。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SimpleMem:让Agent记忆成本暴降30倍!F1提升26.4%的“语义无损压缩”新架构。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
颠覆常识!阿里SkillRouter:Agent选对工具,代码比描述重要44%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
腾讯Youtu-LLM重磅发布:1.96B小模型解锁原生Agent能力,128k长文本与11T数据揭秘。
记忆即算力?阿里ReMe让8B模型超越14B,揭秘动态记忆进化论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent协作双刃剑:性能提升81%,错误放大17倍!DeepMind发布首个量化法则。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
UI-TARS-2:多轮强化学习炼成!达60%人类水平,AI智能体自主操作电脑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据智能体“高考”来了!字节跳动DAComp揭示:顶级模型成功率不足20%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。