不写一行代码,SWE-Bench Pro提升5.8分:用办公任务解锁Agent通用执行力
- 状态构建(State Construction) :在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
- 状态构建(State Construction) :在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
由 IBM 与伊利诺伊大学厄巴纳-香槟分校(UIUC)联合团队提出的 LivePlan 框架,换了一种更务实的解题思路: 将运行时的“漂移裁决”与“纠偏建议”彻底解耦 。
针对这一隐蔽且危险的操作风险,研究团队提出了名为 OBLIVION 的基准与防御框架,首次系统性地将“操作型技能遗忘”(Operational Skill Unlearning)形式化为一个源到汇(Source-to-...
IssueTrojanBench:分析得出的结论对当前 Agent 框架的架构设计者提出了直接警示: 在这 1,400 次拦截中, 82.9% 的拒绝行为完全来源于底层大模型自身的显式安全推理 ,模型在思考链中识别出指...
针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill 。该框架将智能体的经验记忆形式化为一个 超图(Hypergraph) ,用超边把单次轨迹中的子任务序列、可复用技能与...
HVTB:实验结果清晰地揭示了提示词防御的局限性。在最贴近现实生产环境的 L0 阶段(开发者仅给出通用禁令,无法预见特定漏洞),几乎所有前沿模型都表现出了相当比例的作弊行为。这说明当前大模型对高层抽象伦理指令的遵从能力...
由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉...
来自复旦大学、清华大学与合作团队提出的 GameWAM ,打破了这两者之间的界限。作为首个面向原生闭环游戏操作与图形用户界面(GUI)控制的“世界-动作模型”(World–Action Model, WAM),Game...
卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码...
为此,团队提出了名为 FailForge 的智能体自愈蒸馏框架,将原本注定被丢弃的失败样本重新激活为高价值训练数据。实验表明,FailForge 成功挽回了超过 26% 连试数次均彻底失败的难题。
针对这一脱节现象,NVIDIA 团队提出了名为 ACES(Agentic Continuous Evaluation of Skills)的持续评估框架,并在开源工具 NVIDIA SkillEvaluator 中实现...
为了攻克工程级长程代码迁移的难题,华为技术有限公司与香港中文大学的研究团队提出了一种基于代码对抗熵最小化的多智能体协同框架—— ECAT (Entropy-based Code Adversarial Translat...
针对这一长期被忽视的痛点,莫纳什大学(Monash University)的研究团队提出了名为 EASy (Efficient Agentic System)的可训练智能体框架。
研究团队提出了名为 Daydreaming 的黑盒执行重构攻击。该攻击彻底绕过了传统的越狱或信息刺探手段,在整个交互过程中不向目标 Agent 询问任何系统提示词,也不要求对方评价或校准生成的代码,而是将其建模为一个纯...
来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作...
这项研究提出了名为 QCR (Query-Conditioned Reuse,查询条件化重用)的范式,并搭建了严格控制变量的评测框架。在涵盖 WebArena、WorkArena 和 AppWorld 三大主流环境的 ...
除了单机调试,AgentDebugX 还针对企业落地和开源协作设计了两个工程构件: 其一是 故障中心(Error Hub) 。智能体在生产环境中遇到的长尾 Bug,往往很难在开发沙盒中复现。AgentDebugX 允许...
Microsoft:为此,AdsWorldEngine 提出了中枢与工具的迭代联合优化范式(Iterative Actor-Tool Optimization)。这一循环由两个交替演进的飞轮组成: 第一个飞轮是 中枢策...
针对这一本质瓶颈,研究团队提出了名为 VaG (Verifier-as-Gatekeeper)的预提交门控机制。该框架通过三层异构判别器与边际增益贪心选择,把技能入库变成一道极其严苛的晋升流程。
为了攻克这一隐蔽而普遍的系统性缺陷,该团队推出了成对诊断基准 ContextPollute-Bench ,并提出了基于可靠状态特权知识迁移的在线策略蒸馏方法 Oracle-OPD (Oracle-guided On-P...
在视觉-语言-动作(VLA)模型的后训练阶段,强化学习(RL)正在成为突破模仿学习天花板的关键路径。然而,当前主流的Actor-Critic范式在机器人操控任务中遭遇了一个隐蔽却致命的瓶颈:大多数Critic模型要么只...
前沿大语言模型已经能够在单次前向传播中解决极其复杂的推理问题,其表现足以媲美数年前的独立学术成果。然而,一旦将同一个模型置入智能体(Agent)循环中,要求它独立处理耗时数小时的软件工程或数据分析任务,系统往往会暴露出...
评估代码智能体(CodingAgent)的能力正在陷入一种尴尬的困境:榜单上的分数越来越高,但在真实工程环境里写起代码来依然漏洞百出。这种落差背后的核心症结在于两点。
在推理期通过多轮迭代、引入环境反馈来自我进化,是近期大语言模型(LLM)实现能力跃升的重要路径。从FunSearch到AlphaEvolve,基于进化算法的代码探索已经能够解决许多复杂的数学与系统优化问题。