AI Agent 第15页

RILA:浏览器渲染进闭环,9B小模型交互开发反超GPT-5.5

由百度与华中科技大学联合团队提出的 RILA (Rendering-In-the-Loop Agent),正是为了斩断这一死结。RILA 首次将真实的浏览器端到端渲染与运行交互深度引入大模型开发回路,构建了“动作交互验证–多模态诊断–增量工具修复”的动态闭环机制。

RoboBRIDGE:模块化编排让VLA变身真Agent,RoboCasa成功率翻倍

针对此瓶颈,最新提出的 RoboBRIDGE 框架给出了一种模块化编排方案:它不对底层 VLA 进行伤筋动骨的重训,而是在控制策略外层构建了一套由监控器(Monitor)、感知器(Perceptor)、规划器(Planner)、控制器(Controller)和机器人接口(Robot Inter...

LinkedIn自演化客服Agent:免模型微调,工单路由准确率提升30.6%

LinkedIn 建立了一套高度解耦的模块化评估框架,将客服交互质量拆解为互不干扰的独立维度,并分别设计评估策略: - 接地性与事实依据(Groundedness) :专门校验 Agent 生成的每一条事实性断言是否严格由检索到的文档支撑,一旦出现文档未提及的技术细节或操作指引,直接判定为幻觉。

SWE-Bench ProMax:大尺度多语言重构基准上线,前沿模型最高仅达41.2%

SWE-Bench:论文中举出了一个极具代表性的案例:在 NASA 的 F'Prime 飞行软件框架中,一项将单体头文件拆分为全新统一定义入口的重构任务,要求 Agent 同时协同修改跨越自动化代码生成器、设备驱动、操作系统适配层、核心系统服务和构建配置的共计 244 个文件。

AOSpec:动作与观察协同推测,大模型Agent长尾延迟降低42.8%

随着大语言模型(LLM)推理架构的迅猛迭代,解码速度正在被各大服务框架推向极限。无论是专用硬件加速还是投机采样(SpeculativeDecoding),模型输出Token的时间开销已被大幅压缩。然而,在以自主代码编写、系统运维和自动化交互为代表的Agent任务中,用户的真实体感并没有成比例变快。

DataSpace:异构工作区分析新基准,顶尖多模态模型准确率仅66.34%

在企业和科研机构的实际业务中,当分析师需要计算一份基金风险指标或核对季度供应链数据时,答案几乎从来不会现成地躺在某一张干净的数据库表格里。现实中的核心证据往往支离破碎:计算规则可能写在管理规范的PDF报告中,行业基准可能来自一段会议演示视频的解说旁白,而原始的交易明细则分散在本地的SQLite...

DBA-Bench:真实数据库运维实测,AI安全修复率为何仅12.4%?

在大语言模型被推向各类专业运维场景的浪潮中,数据库管理员(DBA)往往被视作最适合被AI替代或赋能的岗位之一。近年来,学术界和工业界接连涌现出如D-Bot、DBAIOps、DBAgent等一系列基于大模型的数据库运维智能体,各大论文汇报的故障诊断准确率动辄高达80%甚至90%以上。

FinEvo-Bench:金融Agent自演化纵向基准,留存经验最高涨19分

绝大多数大语言模型Agent的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。但现实世界中的专业工作流绝非如此。

PatientAgentBench:从答卷到替患者办事,分诊通过率相差56%

医疗大模型正在经历一场从“做题家”到“执行者”的剧烈转折。在过去两三年里,评估一个医学大模型的水平,主流方法几乎都是给它一张考卷:从美国医师执照考试(USMLE)到各科临床单项选择题,只要模型在问答基准上刷出高分,往往就会被冠以“具备医生级水准”的光环。

SeekBrain:用经验配方库驱动多智能体,神经科学基准超 Claude Code 11.7%

现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科学发现的爆发。

SeekJudge:解耦定位与提取,首个在强化学习中超越规则奖励的智能体裁判

在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-UseAgents,CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一个底层瓶颈:系统如何客观判定智能体的一长串操作到底有没有真正完成人类的意图?

SpecBox:推测式沙箱调度消除冷启动,P99延迟降低2.9倍

在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContextProtocol(MCP)为代表的标准化协议,将文件操作、代码执行、网络抓...

长程Agent最新综述!六大生命周期+1547篇论文总结

前沿大语言模型已经能够在单次前向传播中解决极其复杂的推理问题,其表现足以媲美数年前的独立学术成果。然而,一旦将同一个模型置入智能体(Agent)循环中,要求它独立处理耗时数小时的软件工程或数据分析任务,系统往往会暴露出截然不同的脆弱性:遗忘数步之前的关键决策、在代码只修了一半时便草草宣称任务完...