最新发布
AntiSkillBench:当Agent学会“成为你”,个性化技能面临隐私与伪装双重风险
AntiSkillBench:研究者构建了 50 个背景高度丰富、具有不同大五人格(Big Five)特征及沟通风格的虚拟用户画像,设计了涵盖通用助理、数学计算、工具调用等多场景的 2,500 条对话轨迹。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
AntiSkillBench:研究者构建了 50 个背景高度丰富、具有不同大五人格(Big Five)特征及沟通风格的虚拟用户画像,设计了涵盖通用助理、数学计算、工具调用等多场景的 2,500 条对话轨迹。
PAPER INSIGHTS
为此,研究团队提出了名为 ExpG (Experience-Driven adaptive Guidance)的自适应引导机制。该方法不再把工具调用视为孤立、静态黑盒事件,而是将其转化为可归因、可沉淀、可复用的结构化经...
针对这一根本性瓶颈,来自苏黎世联邦理工学院(ETH Zurich)、斯坦福大学、Google、伊利诺伊大学厄巴纳-香槟分校等机构的研究团队提出了 TimeRLM 。
研究团队据此提出了 门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD) 。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验...
针对这一病灶,本文提出了一种极具工程巧思的解法—— 动作松弛期刷新(Actuation-Slack Refresh) :利用机械臂执行动作块时 GPU 闲置的几百毫秒“物理死区”,在推理关键路径之外无条件执行一次完整的...
为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒...
针对这一核心痛点,来自阿里巴巴集团、厦门大学、浙江工商大学和浙江大学的研究团队提出了 Search2Skill 框架。该研究一改过去闭门造车式的反思路线,转向“向外看”(Outward-Looking)的主动探索机制:...
为了破解这一难题,研究团队提出了 RecHarness 。这项工作并未试图训练一个无所不能的端到端超大模型,而是退后一步,为大模型 Agent 建立了一套结合统计决策与程序生成的双层分流驾驭架构(Harness)。
由哈工大、上海人工智能实验室、清华大学、上海交通大学等团队联合提出的 PI-Mem(Parallel-Iterative Memory) ,彻底打破了这一“保精度就必须牺牲吞吐、求轻量就必然遗忘”的权衡困局。
PhyAI:同时,研究团队提出了“控制时间 Roofline 模型”(Control-time Roofline),从系统与控制结合的视角,量化给出了具身推理加速在机器人物理闭环中的真正收益边界。
实验结果显示,以 GLM-5.2 作为驱动底座的 OneDayAgent 取得了 0.821 的综合得分,显著超越基准官方测试的各类通用智能体方案。在遵循指令、事实准确性、逻辑完备性等维度,以及无论是否携带多模态附件的...
针对这一长期被基准评测忽视的现实需求,来自哈尔滨工业大学、美团与鹏城实验室的研究团队提出了 MT-Web2Code 。这是首个专注于多轮宏观区域重构(Macro-Level Regional Reconstructio...
Scale AI 提出的这套以交互为中心的归因体系,其终极价值在于将智能体系统的迭代从盲目调优拉回到精准工程。在未来的智能体流水线中,自动化链路追踪工具可以在执行中断的瞬间,自动抓取交互边状态并运行根因分析:如果责任侧...
FutureBridge-OPD:来自美团等机构的研究者在论文《Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidan...
针对长程人本具身决策的核心瓶颈,最新研究提出了全新的评估基准 DunphyBench ,以及一种由偏好条件引导的多模态记忆压缩框架 MeMento 。该工作不仅系统性地揭示了“无节制堆砌多模态历史上下文反而导致智能体决...
近期提出的 MaAS 虽然尝试通过超网(Supernet)采样单样本结构,但其超网依然在离线阶段被冻结,无法结合运行时的反馈调整结构。针对这一困境,最新研究提出了 GRAFT (Global Optimization ...
FinPerMA:这项研究不仅揭开了大模型在“动态偏好演化”上的认知短板,也对 Agent 记忆系统的工程设计提出了深刻反思。要衡量一个 Agent 是否真正具备个性化能力,金融咨询是一个绝佳的试验场。
为了系统性攻关这一难题,研究团队提出了 DrawAI 框架,构建了一套覆盖四大视觉资产领域、结合确定性规则与多模态大模型裁判的综合评测基准 DrawAI-Bench ,并设计了将感知规划与代码执行拆解的两阶段智能体工作...
为了解决这一难题,DataClawEval 团队设计了一套融合“人在回路(Human-in-the-Loop)”的任务重构与验证管线。如上图所示,整套流水线从企业脱敏源码切入。研究人员首先对生产环境的代码片段进行清洗和...
针对这一困境,开源研究项目 Crayotter 提出了全新范式: GRPB(Group-Relative Preference Backpropagation,组内相对偏好反向传播) 。
针对这一瓶颈,清华大学研究团队提出了一种名为 CofactVLA 的因果反事实去混淆框架。该方法抛弃了以往依赖数据增强或后处理粗暴相减的做法,将动作生成过程形式化为一个双路径去混淆图(Dual-path Deconfo...
针对这一核心痛点,最新研究提出的 CoEvoKG 框架给出了一个极具启发性的闭环解法: 将知识图谱(Knowledge Graph, KG)同时作为可验证训练任务的“发生器”与智能体进化的“永久证据记忆库” 。