AI Agent 第7页

AutoDesign:不是微调模型而是迭代脚手架,得分超Claude Design 7.4分

来自清华大学、北京大学、华中科技大学、美团、MBZUAI、上海交通大学和香港中文大学等机构的研究团队提出了 AutoDesign 框架。这项工作跳出了“微调底层多模态模型权重”的传统路径,而是引入了 元脚手架优化(Meta-Harness Optimization) 机制。

FlowSeal:加州大学用信息流控制切断Agent隐私泄露,降至0.5%

为此,研究团队提出了一种全新的系统级防御框架 FlowSeal。它不再指望大模型在同一个对话窗口里“既当裁判又当选手”,而是跳出模型上下文,在工具调用层构筑起基于数据溯源和信息流控制(Information Flow Control, IFC)的强制拦截器。

EchoPath:告别重复规划,执行级重放让GUI Agent的Token骤降90%

针对这一困境,研究团队提出了 EchoPath ——一种模型无关且环境无关的执行级可重放记忆框架。它不再将历史经验作为冗长的 Prompt 上下文喂回大模型,而是将经过终局验证的 GUI 执行轨迹提炼为标准化的“可调用资产”(类似 MCP 风格的确定性工具)。

世界模型靠不住:TU Berlin 团队证实 Agent 模拟器误判率高达 95%

论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 GITHUB WORKSPACE 理所当然地存在并指向代码仓库路径;然而在智能体运行的实际开发机环境中,该环境变量并未定义。

K-Bench:大模型Agent做科研为何难达标?全员表达强于准确度,31%过度夸大

从技术实现与应用落地来看,K-Bench 的结论向所有试图构建垂直科研智能体的从业者发出了一条清晰信号:当前通用大模型的基础底座,在面对非结构化现实需求时,依然缺乏严谨的自省与工程化定力。要在科研领域真正替代繁杂的体力劳动,仅仅让模型学会利用工具编写文字报告是远远不够的。

MedClaw:不调权重,仅靠100条样本蒸馏拿下长程手术视频时序推理

由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw ,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在架构上严格解耦了“时序规划推理”与“底层视觉感知”。

从“听完再想”到边听边想:不改模型权重让延迟降49%,完成率达73%

我们往往在对方话音未落时就已经开始在大脑中构建回应,在开口陈述当前句子的同时构思下一句表达,即使中途被打断也能迅速吸收新信息并调整思路。然而,当下绝大多数基于大语言模型(LLM)构建的语音智能体(Voice Agents)却表现得格外机械:它们严格遵循着“听完语音输入 沉默思考 开口输出语音”...

OmniReasoner:教全模态模型定向重听重看,长视频推理提升9.9分

来自清华大学、中国科学院、Shopee、北京工业大学和东南大学等机构的研究团队,将这种认知直觉转化为一种原生的后训练框架,提出了 OmniReasoner 。该工作不再执着于通过无限扩展上下文窗口去强行“硬吞”全部音视频信号,而是通过监督微调(SFT)与强化学习(RL)。

中科院提出SciDSK:科学数据打包成Agent技能,24项评估命中23项

针对这一瓶颈,中国科学院与中国科学院大学的研究团队提出了 SciDSK(Scientific Data Skill,科学数据技能) 框架。这项工作的核心构想十分巧妙:不再试图去重构现有的底层数据仓储,也不把数据集当作笨拙的外部检索对象,而是将特定数据集的科学背景、文件层级语义、前置校验规则与端...

TimeSage-EV:首个动态时序智能体基准,大模型归因预测不足47分

TimeSage-EV:目前大模型社区在时序理解上的评测,大多遵循类似 ChatTime-TSQA 或 TSRBench 的思路:给定一段历史数值曲线,向模型提出几个关于极大值、极小值、平均趋势或简单周期的定点问题。另一些通用智能体基准虽然引入了代码执行、网页检索和工具调用,却很少将时间演进作...

AgentSnare:轨迹自适应诱导机制,让AI黑客攻破率全部清零

来自安徽大学、海南大学、香港理工大学、香港大学和浙江大学的研究团队提出了一套名为 AgentSnare 的轨迹自适应欺骗系统。该系统彻底颠覆了“预先埋伏静态诱饵”的传统思路,转向“沿着攻击者的交互轨迹动态展开事实自洽的诱饵环境”。