最新发布
高出0.4分却贵了1431倍!大模型真能取代Embedding吗?
实验结果清晰地绘制出了适用边界: 在以深度因果与复杂推导为特征的 BRIGHT 基准上,单靠强向量模型第一阶段只能拿到 22.3 的 nDCG@10;而一旦在后端引入 LLM 列表重排,最终得分直接跃升至 35.1。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
实验结果清晰地绘制出了适用边界: 在以深度因果与复杂推导为特征的 BRIGHT 基准上,单靠强向量模型第一阶段只能拿到 22.3 的 nDCG@10;而一旦在后端引入 LLM 列表重排,最终得分直接跃升至 35.1。
PAPER INSIGHTS
这项工作并非简单地堆叠视频时长,而是以构建交互式世界模型为导向,发布了包含 128,892 个视频片段、总计达 2,826 小时的大规模真实世界探索数据集。整个数据集覆盖全球 113 个国家和地区,且全部配备了相机运动...
针对这一洞察,本文提出了无需额外训练的解码算法 Ripple-Pivot Search(RPS) 。该方法不仅在空间上精确定位中熵枢纽(Where),更通过轻量前瞻评估在候选词集合中自适应搜索最优 Token(What)。
RealisticTritonBench:实验结果给大模型在底层系统优化上的应用浇了一盆冷水:即使是当前最顶尖的推理与代码模型,在真实系统环境下的综合任务成功率最高也仅有 25.81%,全模型平均成功率低至 18.71%。
为了抹平这一因模态切换带来的能力损伤,研究团队提出了名为 CAPS (Cross-modal Agentic Policy Self-distillation,跨模态智能体策略自蒸馏)的统一训练框架。
该工作不仅建立了一个包含 3,000 个经过真实 API 执行验证的高质量中文测试集,更首次提出了能够实现自我迭代演进的双阶段闭环构建框架 PCCF(PluginEval Closed-Loop Constructio...
清华大学团队提出的 OpenLoopEvolve (简称 OLE )试图从底层逻辑上改变这一现状。该研究不再把交互控制视为不可分割的代码黑盒或易受干扰的纯文本上下文,而是首次提出了可治理、可验证的“循环策略”( Loo...
OmniScientist:真正的科学研究是一个动态闭环:对原始实验数据的直接观察决定了提出什么假说;实验执行后的原始曲线又决定了下一步如何修正方案;最终论文里的每一个主张,都必须严格回溯到观测细节。缺乏端到端感知的自...
无论是各类商业化的研究助手,还是开源社区构建的自动化研究流水线,都在尝试让大语言模型处理极其开放且复杂的调研任务。然而,这类长程(Long-horizon)任务普遍伴随着极其高昂的计算代价:智能体沿着分解出的子问题不断...
针对这一瓶颈,耶鲁大学的研究团队提出了名为 MoRSE (Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts)的新型多智能体框架。
针对这一困境,研究团队提出了 MESA (Multi-structure Evidence Selection framework for long-horizon Agent)。
来自新加坡国立大学、加州大学圣地亚哥分校、浙江大学、南方科技大学等机构的研究团队提出了 Mechanist ,这是首个将 AI 本身作为“科学仪器”,用于全自主探索、解释并干预大模型内部智能机制的 Agent 科学研究系统。
针对这一结构性缺陷,这篇研究提出了 MAP-Graph (Provenance-Aware Shared Memory)。其核心思想可以概括为一句话: 检索不等于授权(Retrieval is not authoriz...
为了解决这一隐蔽的表征瓶颈,本文提出了 SALT (Semantically ALigned action Tokenizer,语义对齐动作分词器)。它打破了传统动作分词器只顾拟合轨迹坐标的范式,通过引入一个冻结的视觉...
KVDiagnosis:为了让长文本推理在有限的硬件上跑得通,工业界与学术界提出了五花八门、令人眼花缭乱的 KV Cache 压缩算法,涵盖 Token 驱逐、层/头动态分配、通道剪枝、低比特量化以及语义块合并等不同技...
由百度、上海交通大学、西安交通大学与中关村学院等机构组成的联合研究团队,针对这一长期困扰 AI for Science 的根本瓶颈,提出了名为 Janus 的算法与评估器协同演化框架。
针对这一行业谜题,来自约翰斯·霍普金斯大学(Johns Hopkins University)的研究团队发表了一篇具有颠覆性质的论文,提出了 “信息丰裕悖论”(Information Abundance Paradox) 。
GitSkills:就在这套极简规范提出短短 9 个月后,来自英国伦敦大学学院(UCL)、德国霍恩海姆大学与意大利卡利亚里大学的联合研究团队展开了一次全面地毯式普查。结果令人震惊:仅仅在 GitHub 的公开仓库中,就...
为了打破空间几何与人类动态行为之间的隔阂,来自 Google Research、马普所(IMPRS-IS)、慕尼黑工大(TUM)、KTH 及斯图加特大学的研究团队联合提出了 GESTO (Grounded Event ...
来自中国科学院与重庆大学的研究团队提出了 GeoForge ,这是一个 免微调(Training-free)、非参数化自进化的地球观测智能体框架 。该研究的核心转变在于:放弃代价高昂且难以持续迭代的模型权重微调,转而在...
来自英国牛津大学、美国普林斯顿大学、麻省理工学院、法国国家信息与自动化研究所(Inria)等多家顶级科研机构的研究团队,针对这一长期被忽视的盲区提出了全新基准: DiG-bench (Discovery in Games)。
针对这一脱节现状,来自华为技术有限公司与伦敦玛丽女王大学的研究团队提出了专门针对电信网络排障能力的智能体基准评测集 CTBench 。这项包含 234 个由一线电信专家深度构建与验证的任务评测揭示了一个耐人寻味且值得警...