最新发布
XBridge:破解异构模型通信瓶颈,延迟降低11倍且全面超越文本交互
针对这一长期困扰异构通信的核心冲突,研究团队提出了名为 XBridge 的免解码(Decode-free)通信协议。该方案将通信解构为离散实体锚点与连续上下文增强两个独立通道,在三大开源模型家族(Llama、Qwen、Mistral)与七大复杂基准测试中,不仅将通信延迟缩减了整整 11 倍。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
针对这一长期困扰异构通信的核心冲突,研究团队提出了名为 XBridge 的免解码(Decode-free)通信协议。该方案将通信解构为离散实体锚点与连续上下文增强两个独立通道,在三大开源模型家族(Llama、Qwen、Mistral)与七大复杂基准测试中,不仅将通信延迟缩减了整整 11 倍。
PAPER INSIGHTS
为了破解这一痛点,浙江大学的研究者们提出了 SkillAligner 。它的核心观点非常清晰: 在 Agent 执行任务前,绝不能把检索到的外部技能当成不容置疑的硬性指令,而应当将其视作“可以随意修改的底稿”(Adap...
针对这一瓶颈,OPPO 联合深圳河套研究院、中山大学及香港中文大学(深圳)的研究团队提出了名为 SCOUT (Self-Checking Chain-Of-Tool-thought)的具备恢复感知能力的智能体框架。
针对这一症结,来自中国传媒大学媒体融合与传播国家重点实验室和智联英和技术团队提出了全新长程记忆框架 RippleMem 。该框架打破了传统记忆系统“单次孤立检索(Isolated Retrieval)”的思维定式,转而...
在大模型工程落地的世界里,训练后量化(Post-Training Quantization, PTQ)早已是事实上的行业标准。绝大多数团队在部署开源模型时,都默认 4-bit 权重属于“几乎无损”的安全区,3-bit ...
为了彻底厘清这一因果关系,Meta 团队提出了一套分层错误归因体系,结合自动化分类与人工语言学家的双重验证,对出现跨语言落差的场景样本进行了严格拆解。归因结果显示,这并非评测噪音主导的假象: - 55% 归因于纯粹的模...
MindMemOS 从根本上重构了记忆的表征形态,提出“实体–属性–时间”三维组织图谱,并配套开发了一套能够主动演化的算法引擎:在线通过紧凑检索与动态图融合吸收上下文,离线通过类似人类睡眠的“做梦(Dreaming)”...
基于此,研究团队提出了 RIFT ( Rollout-free Imagination via Future Tokens )框架。RIFT 彻底摒弃了测试阶段迭代式的视频去噪,仅通过引入一组可学习的“前瞻 Token...
为此,清华大学团队提出了一套全新检测框架,将隐性分歧的挖掘转化为 诊断性多项选择题生成 (Multiple-Choice Question Probing, MCQ Probing),并构建了基准数据集 IoA-Sui...
为了让视觉语言大模型(VLM)真正具备统揽全局的工业级规划能力,研究者提出了名为 Hugin 的全流程优化训练框架,并构建了涵盖四种工业真实布局的基准测试集 SortingBench 。实验结果表明,Hugin 在多个...
由 Scale AI 团队主导的最新研究提出了 HarnessOpt-Bench ,这是业内首个针对“端到端自动化 Harness 优化”建立的标准化评测基准。这项研究跳出了过去各家系统在自选题目、自定规则下的“自嗨式...
针对这一长期困扰界面的双重瓶颈,北京大学的研究团队提出了一种解耦的无回归布局感知匹配框架。该方法的核心思想非常明确: 大模型负责把复杂的自然语言指令“翻译”成富有界面布局细节的视觉描述,而精确定位则交给一个专用的轻量定...
团队提出了 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化) ,通过在参数空间施加严格的双侧正交硬约束,阻止强化学习梯度破坏预训练模型的关键流形结构。
FrontierFinance:他们提出了“细粒度、源头可归因准则”(Source-Attributed Rubrics)评分机制。每一个复杂查询都被专业金融专家拆解为数个到数十个必须满足的事实判断准则,总计构成了 1...
来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林...
针对这一核心瓶颈,来自复旦大学的研究团队提出了名为 FlowScout 的自动化生成框架。FlowScout 不再让大模型空想工作流,而是把工作流形式化为兼具语义推理与真实工具调用的有向无环图,并利用真实执行反馈指导蒙...
针对这一核心痛点,研究团队提出了名为 FlashDrive 的算法-系统协同优化框架。FlashDrive 并没有大动干戈去重构模型底座,而是针对流水线中四个阶段的具体冗余。
他们提出了 FACT(Failure-Aware Causal Training)框架,打破了“先脑补未来、再倒推动作”的定势,颠倒为“先决策动作、再因果推演未来与任务进展”。
卡耐基梅隆大学(Carnegie Mellon University, CMU)机器人研究所的研究团队针对这一系列瓶颈,推出了全新的协同多智能体闭环评测基准 CMU-Drive ,并提出了首个将协同感知、语言推理与动作...
针对这一困境,来自蚂蚁集团、清华大学、明尼苏达大学和浙江大学的研究团队提出了一套名为 HARD (Harness-based Autonomous Runtime Defense Evolution)的自演化运行时防御框架。
为了彻底终结“以代码能否运行来衡量科研真伪”的评估偏见,研究团队提出了名为 ABE-Ralph 的全自动科学审计框架。该框架将科学复现与验证形式化为一个带有资源上限的 约束满足问题 (Constraint Satisf...
Ant:作者将这一现象形式化为 奖励公平性问题(Reward Fairness Problem) ,并提出了系统性的解决方案 ARC(Advantage Regularization via Conditioning) 。