基础模型 第7页

Generative Early Stage Ranking

Meta重塑推荐系统:GESR用“混合注意力”打破双塔模型瓶颈,性能大涨延迟仅增10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

On the Origin of Algorithmic Progress in AI

AI效率万倍增长神话破灭?MIT研究:90%的功劳来自Transformer的规模效应。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Qwen3-VL Technical Report

Qwen3-VL重磅发布:256K上下文,三大架构升级打造全能多模态。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

HunyuanVideo 1.5 Technical Report

83亿参数新SOTA!混元Video 1.5开源,推理加速87%,RTX 4090轻松跑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Virtual Width Networks

字节跳动VWN:不加算力“拓宽”Transformer,训练提速高达3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Sentence-Anchored Gist Compression for Long-Context LLMs

LLM长文本“瘦身”8倍:新方法让模型按“句”读取,性能几乎无损。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Understanding Robustness of Model Editing in Code LLMs: An Empirical Study

本文通过一项在受控环境中进行的系统性实证研究发现,现有的模型编辑方法在更新代码大语言模型(code LLMs)以适应API演进时,表现出有限且不稳定的适应能力,普遍导致模型性能显著下降,且多数成功案例依赖变通方案而非真正采纳新API。

Deep sequence models tend to memorize geometrically; it is unclear why

本文通过一个精心设计的实验揭示,深度序列模型在记忆事实时并非简单地存储局部关联,而是会自发形成一种“几何式记忆”结构,这种结构编码了实体间(包括训练中未共现的实体)的全局关系,从而将复杂的多步推理任务简化为易于学习的单步几何问题。

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

本文提出了一种名为 LTE(Learning to reason from Trial and Error) 的方法,通过利用大语言模型(LLM)自身在推理失败时产生的错误答案作为提示信息,来克服强化学习中的探索停滞问题,从而无需任何外部专家指导即可提升模型的推理能力。

Remote Labor Index: Measuring AI Automation of Remote Work

本文提出了一种名为远程劳动指数(Remote Labor Index, RLI)的新基准,通过评估AI智能体在真实自由职业平台上的端到端项目完成能力,来衡量AI在具有经济价值的实际任务上的自动化水平,从而为追踪AI的经济影响提供了实证基础。

A Survey of AI Scientists: Surveying the automatic Scientists and Research

本文首次对新兴的 AI 科学家 (AI Scientist) 领域进行了系统性综述,提出了一个统一的六阶段科学工作流框架,并基于此框架梳理了从 2022 年到 2025 年的关键研究,揭示了该领域从基础模块化、闭环集成到追求可扩展性、影响力与人机协作的清晰三阶段演进脉络。

Relative Scaling Laws for LLMs

本文提出了一种名为“相对缩放定律 (Relative Scaling Laws)”的新框架,用于量化随着计算规模的增加,不同数据分布上的性能差距如何演变,揭示了规模增长并非普适的均衡器,其影响因领域而异。

Tongyi DeepResearch Technical Report

本文介绍了通义深搜(Tongyi DeepResearch),一个开源的AI研究智能体,它通过创新的“智能体中训练”与“智能体后训练”两阶段训练框架,结合可扩展的合成数据引擎,实现了领先的深度研究能力。

Are Large Language Models Sensitive to the Motives Behind Communication?

本文通过借鉴认知科学的理性模型,系统性地研究了大型语言模型(LLMs)是否能像人类一样识别和评估沟通背后的动机(即“动机警惕性”),发现它们在受控实验中表现出类似人类的能力,但在复杂的现实世界场景中表现不佳,不过简单的引导提示可以改善其表现。

KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models

本文提出了一种名为 KCM (KAN-Based Collaboration Models) 的大-小模型协同框架,它利用一个基于 Kolmogorov-Arnold Network (KAN) 的小型判断模型,智能地将输入样本分配给高效的小模型或强大的预训练大模型处理,并通过提示修改和知识蒸...

Relative-Based Scaling Law for Neural Language Models

本文提出了一种基于相对排序的新指标——相对概率(RBP),并据此建立了相对标度律(Relative-Based Scaling Law),该定律揭示了模型将正确答案排在靠前位置的能力如何随模型规模的增大而遵循幂律提升,为理解大语言模型提供了补充交叉熵的全新视角。

LLMs Encode How Difficult Problems Are

本文通过一系列实验发现,大型语言模型(LLMs)的内部激活向量中,确实以线性的方式编码了问题的难度,但这种编码与人类判断的对齐程度远高于与其它LLM性能评估的对齐程度;并且,在强化学习训练过程中,与人类判断一致的难度表征会得到加强,而与LLM性能相关的难度表征则会退化。