推理 第2页

NeSy-Spatial:告别盲目规划与死板流水线,空间推理技能实现自演进

针对这一核心痛点,研究团队提出了名为 NeSy-Spatial 的神经符号空间技能自演进框架。该框架放弃了从零临时规划或套用僵化模板的做法,而是将工具交互与几何算法解耦并抽象为可执行的原子指令,进一步组合成 Tool-Use Skills(工具调用技能)与 Geometry Skills(几何...

UAV-MAS:无需训练的多智能体系统,让32B模型反超Gemini 3 Pro

该团队联合推出了首个面向无人机多任务综合推理的评测基准 UAVQA-Bench ,并设计了一套免训练的航拍多智能体系统 UAV-MAS 。这套系统无需改动底层模型权重,仅依靠 Qwen3-VL-32B 开源底座,便在 UAVQA-Bench 综合准确率上达到 77.0%。

Trie Automata:前缀树预计算掩码,vLLM推理吞吐提升29倍

针对这一结构错配,来自亚马逊的研究人员提出了专为大规模有限集合约束设计的解码后端——Trie Automata(前缀树自动机)。该方案摒弃了通用文法编译路线,基于字符级前缀树(Character-Level Trie)并引入经典 Aho-Corasick 多模式匹配算法,在离线阶段预计算节点合...

AngelSpec:不再押注单一草稿机制,大模型推理加速达 2.4 倍

针对这种结构与业务分布的割裂,腾讯提出了 AngelSpec 这一统一的投机推理训练与系统框架。该方案的核心思想非常务实: 不再试图训练一个放之四海而皆准的“通用草稿模型”,而是在训练数据、模型架构和推理调度三个层面做结构与任务的协同特化 。

Kalypso:打破算子物化壁垒,关系型LLM推理实现4.57倍提速

来自马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在论文《Kalypso: Relational LLM Serving》中提出了破局方案。该研究定义了“关系型 LLM 推理”(Relational LLM Serving)这一全新抽象层,并构建了名为 Kalypso 的执行系统。

PoTRE:多拓扑推理打破群体思维,让轻量模型在HLE达到49.92%

针对这一瓶颈,研究人员提出了 PoTRE(Poly-Topological Reasoning Ensembles)框架。该工作受到人类“认知异质性”(Cognitive Heterogeneity)的启发,认为复杂难题的攻克从来不依赖单一思维模式的无限重复,而取决于互补认知策略的协同碰撞。

SCHEMA:用知识拓扑揪出科研Agent幻觉,终局正确率与推理过程严重脱钩

通过这种方式,SCHEMA 提出了 拓扑加权幻觉严重性指标 ( )。借助自动化的知识图谱构建流程,SCHEMA 涵盖了从分子机制(蛋白质域)到复杂病理交互(PathVQA-Enhanced)的不同复杂度基准,并基于图谱节点度数将概念划分为核心层(Core)、外围层(Peri.)和图外层(Off)。

MedClaw:不调权重,仅靠100条样本蒸馏拿下长程手术视频时序推理

由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw ,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在架构上严格解耦了“时序规划推理”与“底层视觉感知”。

OmniReasoner:教全模态模型定向重听重看,长视频推理提升9.9分

来自清华大学、中国科学院、Shopee、北京工业大学和东南大学等机构的研究团队,将这种认知直觉转化为一种原生的后训练框架,提出了 OmniReasoner 。该工作不再执着于通过无限扩展上下文窗口去强行“硬吞”全部音视频信号,而是通过监督微调(SFT)与强化学习(RL)。