最新发布
东大提出VLAff:从20万人类视频统一抓取与轨迹,零样本落地真机操作
团队构建了一个拥有 20.4 万条视频片段、千万级标注的大规模第一人称数据集 EgoAffordance ,并在此基础上提出了统一的多模态视觉-语言-操作引导模型 VLAff (Vision-Language-Affordance Model)。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
团队构建了一个拥有 20.4 万条视频片段、千万级标注的大规模第一人称数据集 EgoAffordance ,并在此基础上提出了统一的多模态视觉-语言-操作引导模型 VLAff (Vision-Language-Affordance Model)。
PAPER INSIGHTS
针对这一核心冲突,最新研究提出了名为 SyncPlan 的“规划-执行-修正”(Plan-Execute-Correct)长程多智能体协同框架。该框架让中心化 LLM 在单次调用中生成带有显式同步原语的长程动作链,在底...
这项研究正式提出了“多步间接提示注入”攻击范式,并开源了专门针对 CUA 评估的基准测试框架 StepJack 。实验揭示了一个令人警惕的结论:拆解并非削弱了攻击威力,反而是绕过安全机制的倍增器。
面对这一困局,来自阿里巴巴和清华大学的研究团队提出了全新的解决思路: State2State 。这项研究不再纠结于“如何让人类或更强的大模型生成更多任务”,而是退回智能体交互的最本质关系——智能体与环境。
为此,本文提出了 HL-Gauss PPO :彻底放弃标量的 MSE 回归头,改用带有高斯平滑的离散分类头来学习价值分布,最后仅通过求期望还原出标量值供 PPO 使用。
针对这一长期记忆难题,来自北京大学的研究团队提出了 SodaMem 。该工作将 Agent 的长期记忆重新定义为一种强证据溯源的时序知识图谱(Evidence-Grounded Temporal Graph Memory)。
针对这一问题,该研究提出了包含 61,228 个技能的新基准 SkillReason-Bench ,并设计了名为 SkillReason 的双阶段推理增强框架。
面对这个难题,来自字节跳动、上海交通大学、清华大学、香港大学和东京大学的研究团队提出了全新视角:将大模型时代的后训练数据选择转化为一个成熟的“工业级推荐系统问题”,并推出了相似性数据挖掘框架 SiMDex 。
为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed (简称 SYF )的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显...
针对这一核心痛点,研究团队提出了名为 NeSy-Spatial 的神经符号空间技能自演进框架。该框架放弃了从零临时规划或套用僵化模板的做法,而是将工具交互与几何算法解耦并抽象为可执行的原子指令,进一步组合成 Tool-...
为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止...
本文提出了 轨迹后门攻击 ( Trajectory Backdoor Attack ,简称 TBA )。在完全无需触碰技能代码、没有任何提权行为,甚至仅拥有普通用户提问权限(Query-only)的前提下,攻击者只需巧...
针对这一核心痛点,来自佐治亚理工学院(Georgia Institute of Technology)与莱斯大学(Rice University)的研究团队提出了名为 DyLaR (Dynamic Latent Rea...
针对这一本质矛盾,研究团队提出了全新的视觉工具轨迹构建框架 OpenVisTool 。该工作的核心见解在于:一条有价值的教学轨迹,必须同时满足 结果正确性(Outcome Validity) 与 因果效用(Causal...
针对这一核心瓶颈,来自华为、慕尼黑大学(LMU)、慕尼黑工业大学(TUM)、浙江大学等机构的研究团队提出了 MemWM (Memory-Augmented Text-Based World Model)。
为此,研究团队提出了 MemOPD (Memory-Aligned On-Policy Distillation)框架,在长程问答基准上使 3B 模型的 F1 值相比纯 PPO 基线最高跃升 416.2%,并在保证数值...
来自哔哩哔哩(Bilibili)与复旦大学的研究团队在最新论文中提出了 MemeMind 框架,专门针对这一盲区提出了破局方案。MemeMind 的核心亮点在于 参考答案引导的工具轨迹重构 :它在离线阶段利用终局的参考...
来自约翰斯·霍普金斯大学、微软研究院(Microsoft AI Frontiers)与普林斯顿大学的研究团队,在最新论文中直击这一结构性缺陷,提出了 Full-bandwidth Transformer 。
为了打破这种“只管生成、不保求真”的流水线局限,研究团队提出了名为 EviGraph 的全新自主科研框架。EviGraph 将科研过程从单向的流水线执行,重构成以“有类型证据图”(Typed Evidence Grap...
针对这一断层,来自韩国京畿道教育研究院、印第安纳大学、高丽大学等机构的研究团队提出了 EduClaw-Bench 。这是首个将智能体导师置于 30 天连续虚拟教学环境中的长周期评测基准。
Canary:这项研究表明,工具描述中的“吹嘘”行为是一种极其危险的系统性隐患。哪怕是公认最聪明的基础模型,也会被带有“高级”、“全功能”标签的工具误导。因此,在平台层对工具的描述进行格式化清洗、限制夸大修辞,并对重叠...
来自中国科学院、上海交通大学以及上海期智研究院的研究团队针对该瓶颈,提出了软硬件协同设计的专用加速框架 Deltoris。该框架敏锐地抓住了机器人高频控制场景中的物理连续性特征——相邻两帧之间的视觉和状态输入往往拥有高...