DyLaR:视频问答告别千字长CoT,不到20个Token准确率提升4.2分!
针对这一核心痛点,来自佐治亚理工学院(Georgia Institute of Technology)与莱斯大学(Rice University)的研究团队提出了名为 DyLaR (Dynamic Latent Reasoning,动态隐式推理)的全新框架。
针对这一核心痛点,来自佐治亚理工学院(Georgia Institute of Technology)与莱斯大学(Rice University)的研究团队提出了名为 DyLaR (Dynamic Latent Reasoning,动态隐式推理)的全新框架。
针对这一核心痛点,研究团队提出了名为 NeSy-Spatial 的神经符号空间技能自演进框架。该框架放弃了从零临时规划或套用僵化模板的做法,而是将工具交互与几何算法解耦并抽象为可执行的原子指令,进一步组合成 Tool-Use Skills(工具调用技能)与 Geometry Skills(几何...
该团队联合推出了首个面向无人机多任务综合推理的评测基准 UAVQA-Bench ,并设计了一套免训练的航拍多智能体系统 UAV-MAS 。这套系统无需改动底层模型权重,仅依靠 Qwen3-VL-32B 开源底座,便在 UAVQA-Bench 综合准确率上达到 77.0%。
来自阿里巴巴与上海交通大学的研究团队提出了全新框架 (Compressed and Composable KV),通过解耦基座模型与缓存抽取过程,构建出一种既高倍压缩又具备“即插即用”拼装能力的 KV 缓存流形。
针对这一核心痛点,香港科技大学与华为的研究团队提出了 InSight-doc 。该工作颠覆了以往默认必须把全量高分辨率图像一次性灌入模型的做法,将“视觉分辨率”重新定义为一种在推理阶段可被模型主动调度的计算资源。
针对这一瓶颈,研究团队提出了一种轻量级的上下文提纯器(Context Refiner),并通过强化学习框架 CRRL 将动态提问提纯机制无缝融入 Agent 训练全流程,实现了在显著降低检索频次与上下文长度的同时,大幅拉升问答准确率。
为了从根本上解决这一问题,研究团队提出了 Chain of Computation (COC) 计算架构,并引入了 Structured Context Window (SCW) 。
针对这一结构错配,来自亚马逊的研究人员提出了专为大规模有限集合约束设计的解码后端——Trie Automata(前缀树自动机)。该方案摒弃了通用文法编译路线,基于字符级前缀树(Character-Level Trie)并引入经典 Aho-Corasick 多模式匹配算法,在离线阶段预计算节点合...
针对这种结构与业务分布的割裂,腾讯提出了 AngelSpec 这一统一的投机推理训练与系统框架。该方案的核心思想非常务实: 不再试图训练一个放之四海而皆准的“通用草稿模型”,而是在训练数据、模型架构和推理调度三个层面做结构与任务的协同特化 。
来自马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在论文《Kalypso: Relational LLM Serving》中提出了破局方案。该研究定义了“关系型 LLM 推理”(Relational LLM Serving)这一全新抽象层,并构建了名为 Kalypso 的执行系统。
微软提出的 Mage-VL 试图从根本上颠覆这种帧级离线处理范式。它借鉴了现代视频编解码器与生物视觉的双系统机制,构建了一套“编解码原生(Codec-Native)”的流式多模态基座模型。
针对这一瓶颈,研究人员提出了 PoTRE(Poly-Topological Reasoning Ensembles)框架。该工作受到人类“认知异质性”(Cognitive Heterogeneity)的启发,认为复杂难题的攻克从来不依赖单一思维模式的无限重复,而取决于互补认知策略的协同碰撞。
北京邮电大学、南洋理工大学以及国网辽宁省电力有限公司的研究团队在论文《PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems》中提出了联合决策框架 PowerAtlas 。
针对端侧 Agent 在算力成本、可靠性与云端协同之间的多重冲突,研究团队提出了名为 TSDS (Think Short, Defer Smart,意为“短思考、巧转交”)的协同框架。
近期提出的 MaAS 虽然尝试通过超网(Supernet)采样单样本结构,但其超网依然在离线阶段被冻结,无法结合运行时的反馈调整结构。针对这一困境,最新研究提出了 GRAFT (Global Optimization and Inference-Time Region Grafting)。
PhyAI:同时,研究团队提出了“控制时间 Roofline 模型”(Control-time Roofline),从系统与控制结合的视角,量化给出了具身推理加速在机器人物理闭环中的真正收益边界。
由哈工大、上海人工智能实验室、清华大学、上海交通大学等团队联合提出的 PI-Mem(Parallel-Iterative Memory) ,彻底打破了这一“保精度就必须牺牲吞吐、求轻量就必然遗忘”的权衡困局。
通过这种方式,SCHEMA 提出了 拓扑加权幻觉严重性指标 ( )。借助自动化的知识图谱构建流程,SCHEMA 涵盖了从分子机制(蛋白质域)到复杂病理交互(PathVQA-Enhanced)的不同复杂度基准,并基于图谱节点度数将概念划分为核心层(Core)、外围层(Peri.)和图外层(Off)。
为了让视觉语言大模型(VLM)真正具备统揽全局的工业级规划能力,研究者提出了名为 Hugin 的全流程优化训练框架,并构建了涵盖四种工业真实布局的基准测试集 SortingBench 。实验结果表明,Hugin 在多个开源大模型基座上均取得了显著提升。
针对这一瓶颈,OPPO 联合深圳河套研究院、中山大学及香港中文大学(深圳)的研究团队提出了名为 SCOUT (Self-Checking Chain-Of-Tool-thought)的具备恢复感知能力的智能体框架。
华为技术有限公司联合北京大学、东南大学提出了端到端智能体应急响应规划框架 STAIR(State-driven, Stage-specialized, and Experience-supported Incident Response)。
由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw ,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在架构上严格解耦了“时序规划推理”与“底层视觉感知”。
来自清华大学、中国科学院、Shopee、北京工业大学和东南大学等机构的研究团队,将这种认知直觉转化为一种原生的后训练框架,提出了 OmniReasoner 。该工作不再执着于通过无限扩展上下文窗口去强行“硬吞”全部音视频信号,而是通过监督微调(SFT)与强化学习(RL)。
研究包含两项核心成果:一是提出专门解耦环境推进与控制计算的动态评测基准 ReflexBench ,支持在同步与异步模式下精准注入真实物理延迟;二是构建了参数量不足 1B 的紧凑型模型 ReflexVLA 。