最新发布
W2-VLA:手腕视角不应只是并列输入!任务引导前瞻预测,LIBERO达98.5%
W2-VLA:为了打破这一瓶颈,研究团队提出了 。该框架并没有在像素空间去费力重建未来的整幅图像,而是巧妙地在潜空间(Latent Space)中打通了一条“从世界到手腕”(World-to-Wrist)的前瞻通路。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
W2-VLA:为了打破这一瓶颈,研究团队提出了 。该框架并没有在像素空间去费力重建未来的整幅图像,而是巧妙地在潜空间(Latent Space)中打通了一条“从世界到手腕”(World-to-Wrist)的前瞻通路。
PAPER INSIGHTS
针对这一困境,研究人员提出了 TraceCompiler 。这项工作的核心构想是将 Agent 在多次探索中留下的嘈杂、混乱的执行轨迹(Traces),通过无监督聚类、行为去噪和严格的数据流依赖分析,“离线编译”为结构...
为了从根本上消除这种被称为“记忆污染(Memory Pollution)”的退化现象,作者团队提出了 TEPA。这套机制改变了以往只管存入、不管注销的记忆范式,将“先例(Precedent)”的有效性(Validity...
他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应...
为了打破这种“见过即会、重组即废”的僵局,来自北京师范大学、南洋理工大学与清华大学的研究团队提出了名为 SkillMemo(Skill-Based Memory)的技能记忆增强框架。
针对这一顽疾,来自微软、不列颠哥伦比亚大学、加州大学圣迭戈分校与中国科学技术大学的研究团队提出了名为 SkillHEX 的全新闭环自演化框架。该方案打破了传统的单线盲目试错范式,将科学研究中的“假设检验”思想引入技能排...
来自南开大学的研究团队提出了 SkillConsist,专门针对 Agent 技能包中“文档声明”与“代码实现”的一致性检测与代码级精确定位。该研究跳出了过去将文本与代码做简单匹配或死板套用安全分类树的思路。
这项工作提出了首个专门评估渐进式披露机制下智能体技能调用能力的基准—— Skill-Use 。在覆盖 9 大领域的 177 个真实任务测试中,即便集结了业内最顶尖的前沿模型(包括 GPT-5.5、Claude Opus...
由腾讯、上海交通大学与香港城市大学联合提出的 SeqLLM 框架直面这一核心矛盾。该研究并不依赖传统“先破坏、再修复”的持续预训练加蒸馏路径,而是通过紧凑的离散字段级词表、文本接地的轻量投影器以及 前缀引导能力注入(P...
为此,研究者提出了名为 SPIRAL (Self-improving Path Integration and Realignment)的自监督对齐框架。该框架不需要任何外部标注或更大的教师模型,仅利用大模型自身的原生...
为了打破这一僵局,研究团队提出了轻量级的句子级检测框架 CAD (Context-Aware Detection,上下文感知检测)。CAD 不仅通过联合建模用户查询、上下文及目标句子的边缘影响来判断其恶意程度。
来自四川大学的研究团队提出了 RA-CAD (ReAct Agent for CAD),从根本上重构了这一范式:研究者不再把执行后审查当成孤立的外部提示,而是将其拆解为智能体策略内部的显式决策动作,通过两阶段优化(CC...
为此,研究团队提出了“以智能体为中心的世界代理”(Agent-Centric World Proxy)这一新范式,将世界模型从单调的“物理状态预测器”升级为能够处理执行、记忆、技能与校验的“信息状态转移器”。
来自香港大学与清华大学的研究团队提出了 PhysMind 。这套完全免训练(Training-Free)的智能体框架改变了以往直接让 VLM 端到端脑补的做法:它 为每段视频仅构建一次可复用、与具体问题无关的“可执行物...
近日,来自字节跳动、佐治亚理工学院、加州大学圣地亚哥分校(UCSD)以及马里兰大学帕克分校的研究团队提出了一项颠覆性的训练范式: 无监督在线自蒸馏(Unsupervised On-Policy Self-Distill...
由中国科学院空天信息创新研究院、目标认知与应用技术重点实验室以及上海交通大学人工智能学院等机构组成的研究团队,提出了名为 Lingjing (灵境)的开放城市异构多智能体具身仿真评测平台。
针对这一结构性断层,来自北京智源人工智能研究院(BAAI)与北京大学的研究团队提出了名为 LifelongCrossNav 的具身导航框架。该框架首次将支撑感知的 3D 稀疏体素建图、任务无关的持久视觉语言特征记忆、阶...
为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷...
他们提出的 HLSmith 框架将 C 到 HLS 的转换重新定义为“硬件微架构演进”,而非单纯的“代码翻译”。该框架不仅提炼了硬件专家优化技巧并将其模块化、守卫化(guarded recipes),还通过分阶段编译反...
为了彻底解决这一困境,研究团队提出了 FocusMem 。它不再试图打造一个容量更大的黑盒压缩器,而是将隐式记忆的职责明确解耦为三个维度: 存什么(内容基底) 、 怎么看(状态自适应读取) 以及 信不信(置信度门控) 。
EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进...
针对执行引导自纠错中的信任危机,来自北京航空航天大学的研究团队提出了 ExeCRE(Execution-Consistency guided code Reliability Estimation)框架。