最新发布
Trie Automata:前缀树预计算掩码,vLLM推理吞吐提升29倍
针对这一结构错配,来自亚马逊的研究人员提出了专为大规模有限集合约束设计的解码后端——Trie Automata(前缀树自动机)。该方案摒弃了通用文法编译路线,基于字符级前缀树(Character-Level Trie)并引入经典 Aho-Corasick 多模式匹配算法,在离线阶段预计算节点合规掩码。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
针对这一结构错配,来自亚马逊的研究人员提出了专为大规模有限集合约束设计的解码后端——Trie Automata(前缀树自动机)。该方案摒弃了通用文法编译路线,基于字符级前缀树(Character-Level Trie)并引入经典 Aho-Corasick 多模式匹配算法,在离线阶段预计算节点合规掩码。
PAPER INSIGHTS
香港科技大学(HKUST)的研究团队在最新论文中提出了 SynWeaver 框架。这项研究的核心洞见在于: 高质量的 Web Agent 训练数据不能由离散的任务和孤立的轨迹拼凑而成,而必须将“目标网站的拓扑先验”与“...
SteerBench-Work 最具突破性的设计在于其构建的“证据翻转镜像”(Evidence-Reversed Mirrors)。研究团队选取了最典型的真实事故场景,完整保留其表层的操作危险特征,但将背后的验证状态彻...
针对这一瓶颈,来自字节跳动、北京大学和上海交通大学的研究团队提出了全新的解决方案 SkillLens 。该方案将非结构化的人机交互经验重构成一种名为 视觉技能卡 (Visual Skill Cards, VSC)的状态...
这项研究提出了轻量级学习机制 OAS(Offline Abstraction-Safety) ,不仅在理论上将“何时整合(When)”与“用何种算子整合(Which)”统一到一个效用决策框架中,更证明了记忆管理的最优策...
来自哥伦比亚大学、乔治城大学与 Capital One 的研究团队在深入解剖这一现象后,提出了一套全新的系统性解决方案。在底层大模型完全固定为 GPT-5-mini、不改动任何模型权重的严苛前提下,仅通过对智能体架构(...
针对这一矛盾,ProEvent 提出了一套“先定骨架、逆向推导、层层加噪”的数据合成流水线。整个流程如图 2 所示,主要划分为四个系统化阶段: 第一阶段是 联系人画像池构建 。
为了从根本上解决这一问题,研究团队提出了 Chain of Computation (COC) 计算架构,并引入了 Structured Context Window (SCW) 。
来自 AMI Labs、Meta-FAIR 与纽约大学(NYU)的研究团队提出了一套优雅而高效的替代方案: Patch Policy 。该研究的核心论点十分清晰: 具身控制真正需要的并非庞大的自回归语言模型,而是未经粗...
来自 IBM Research 的研究者在论文《Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimi...
该团队构建了针对智能体可靠性度量的评测基准 AgentRelBench ,在企业运维仿真环境 EnterpriseOps-Gym 上对 6 个主流模型家族的 9 款代表性模型进行了多达 2,128 次独立运行测试。
针对这一瓶颈,研究团队提出了一种轻量级的上下文提纯器(Context Refiner),并通过强化学习框架 CRRL 将动态提问提纯机制无缝融入 Agent 训练全流程,实现了在显著降低检索频次与上下文长度的同时,大幅...
针对这一核心痛点,香港科技大学与华为的研究团队提出了 InSight-doc 。该工作颠覆了以往默认必须把全量高分辨率图像一次性灌入模型的做法,将“视觉分辨率”重新定义为一种在推理阶段可被模型主动调度的计算资源。
凯斯西储大学(Case Western Reserve University)的研究团队提出了一种截然不同的解法: CoRe(Counterfactual Realignment,反事实重整) 。
东京理科大学团队提出的 GaussMemory 打破了这一僵局。该方案放弃了被动存储的死板逻辑,转向由任务驱动的“主动记忆”范式。论文的核心主张是:机器人不应该只是记录它看到了什么,而应该端到端地学会“如何去记”——自...
针对这一痛点,一项最新研究正式提出了 故障后记忆恢复 (Post-failure Memory Recovery)任务,并设计了一套 依赖引导的回滚修复 (Dependency-Guided Rollback Repa...
来自南洋理工大学、上海交通大学与 ACE Robotics 的联合团队提出了 ForeWAM (Foresight-without-Seeing WAM)。这项研究的核心结论是: 直接策略型的世界动作模型无需在部署阶段...
针对这一严重的工业落地痛点,中国移动等机构的研究团队提出了全新的基准测试集 EnterpriseRAG 。该项研究揭示了一个此前被传统基准广泛忽视的残酷事实:在真实的复杂约束条件下,主流大模型对单个指令约束的平均满足率...
DRNoise:为了排除检索框架与工具协议差异对实验结果的干扰,研究团队将所有参评模型置于完全相同的 BrowseComp-Plus 智能体框架内,采用标准的 ReAct(Reasoning + Acting)交互模式...
来自中国科学院与重庆长安科技的研究团队提出了 DriveVLA-M0 。这项工作不再试图通过无休止的离线全量重训来抹平所有长尾错误,而是开创性地为自动驾驶VLA系统构建了一套带有“失败感知”的结构化隐式记忆库与测试时自...
DeepMind:如果在前一到两轮,模型由于搜索空间过于宽泛而提出了边缘化、无信息增益的问题,其在后续轮次中自主“纠偏”的能力极其孱弱。早期恢复斜率分析证实,大部分开源与闭源模型在偏离正确依赖路径后,随着交互轮次增加,...
由微软研究院、英伟达、纽约大学、普林斯顿大学与耶鲁大学等机构联合提出的 Dion3,正是针对这一系列系统与算法痛点交出的全栈答案。Dion3 从底层硬件算子、数学算法重构、优化器更新机制到分布式通信策略进行了彻底改造,...