基础模型 第8页

All You Need is One: Capsule Prompt Tuning with a Single Vector

本文提出了一种名为胶囊提示调优(Capsule Prompt Tuning, CaPT)的新型参数高效微调方法,通过将实例感知(instance-aware)信息和任务感知(task-aware)信息创新性地融合到一个单一的“胶囊”提示向量中,解决了传统提示学习方法依赖繁琐的长度搜索且与输入序...

Rethinking Cross-lingual Gaps from a Statistical Viewpoint

本文从统计学视角重新审视了大型语言模型的跨语言知识差距问题,提出这一差距主要源于目标语言(target language)响应的方差增大,而非知识传递失败所导致的偏差(bias),并通过创新的偏差-方差分解框架和一系列实验验证了该假设。

Robust Layerwise Scaling Rules by Proper Weight Decay Tuning

本文提出了一种针对矩阵类参数的权重衰减缩放规则 ( ),通过在AdamW训练的稳态下保持子层增益在不同模型宽度下的不变性,从而扩展了最大更新参数化( P)框架,实现了学习率和权重衰减超参数的零样本迁移。

Zero-Shot Performance Prediction for Probabilistic Scaling Laws

本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero-shot)预测,进而以更低的计算成本生成概率性的缩放定律(scaling ...

Midtraining Bridges Pretraining and Posttraining Distributions

本文系统地研究了“中训练 (Midtraining)”这一新兴实践,发现其通过在通用预训练和特定任务微调之间构建一个分布桥梁,能有效提升模型在数学和代码等领域的下游任务性能,并显著减少灾难性遗忘。

Predicting Task Performance with Context-aware Scaling Laws

本文提出了一个简洁、可解释的上下文感知缩放定律 (context-aware scaling law) 框架,该框架通过一个函数联合建模了训练计算量和上下文长度,从而能够准确预测和推断大型语言模型在下游任务中的性能。

xLLM Technical Report

本文提出了一种名为 xLLM 的智能高效的大语言模型推理框架,其采用创新的服务-引擎解耦架构,通过智能调度与系统级协同优化,专为高性能、大规模的企业级服务而设计,解决了混合负载、资源利用率低和硬件适配性差等核心挑战。

Large Language Model Sourcing: A Survey

大语言模型溯源:一篇综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Artificial Hippocampus Networks for Efficient Long-Context Modeling

本文提出了一种名为人工海马网络(Artificial Hippocampus Networks, AHN)的框架,通过一个可学习的循环模块将滑窗外的Key-Value缓存压缩为固定大小的长期记忆,从而在显著降低计算和内存成本的同时,高效地处理长序列上下文。

Large Language Models Meet Virtual Cell: A Survey

本文全面综述了大型语言模型(LLM)在构建“虚拟细胞”(virtual cell)——一个能够表示、预测和推理细胞状态与行为的计算系统——中的应用,并提出了一个将现有方法分为“作为预言机的LLM”(LLMs as Oracles)和“作为智能体的LLM”(LLMs as Agents)两大范式...

Who Said Neural Networks Aren't Linear?

本文提出了一种名为 Linearizer 的新架构,通过将一个线性算子置于两个可逆神经网络之间,使得传统的非线性映射在特定构造的向量空间中表现为严格的线性变换,从而能够将线性代数的强大工具(如SVD、伪逆)应用于深度学习模型。

Expand Neurons, Not Parameters

本文提出了一种名为“固定参数扩展”(Fixed Parameter Expansion, FPE)的方法,通过在不增加非零参数总数的情况下增加网络中的神经元数量,来减少由特征叠加(superposition)引起的干扰,从而提升模型性能。

Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

本文提出了一种名为 TRAC 的在线强化学习后训练方法,利用模型自身的自注意力机制来识别并压缩冗余的推理步骤,并根据动态评估的任务难度自适应地调整压缩程度,从而有效缓解大模型在简单任务上“过度思考”和在困难任务上“思考不足”的问题。

Reflect before Act: Proactive Error Correction in Language Models

本文提出了一种名为 REBACT 的新方法,在大型语言模型 (LLM) 执行下一步行动前增加了一个“反思”步骤,通过主动纠正先前动作中的错误,从而显著提升了其在交互式决策任务中的性能和计算效率。

BEFT: Bias-Efficient Fine-Tuning of Language Models

本文提出了一种偏置高效微调方法 (Bias-Efficient Fine-Tuning, BEFT),其核心是一种通过计算微调前后偏置向量的投影比率来评估重要性的新方法,从而能够更精确地选择出对下游任务最关键的偏置项(如Q/K/V投影中的偏置)进行微调,以极低的参数量实现卓越性能。

WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research

本文提出了 WebWeaver,一个模仿人类研究过程的双智能体框架,其中规划器(Planner)通过迭代优化大纲并搜集证据,构建动态且有来源依据的报告结构,而写作者(Writer)则分章节、有针对性地从记忆库中检索信息进行写作,有效解决了传统方法的静态规划缺陷和长上下文处理失败问题,在开放式深...

Opal: An Operator Algebra View of RLHF

本文提出了Opal,一个用于强化学习从人类反馈(RLHF)的算子代数视图,以及GKPO,一个标准化的交换模式,通过一个当且仅当满足三个核心假设时成立的约简定律,来统一、比较和验证不同的RLHF目标函数,从而整理了该领域繁杂的方法。

The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences

本文为生命科学领域的研究人员提炼了一份提示工程(Prompt Engineering)快速入门指南,重点介绍了六种核心技术(零样本、少样本、思维生成、集成、自我批评和分解),并提供了具体的用例、最佳实践和常见陷阱,旨在帮助研究人员从机会主义的提问方式转变为系统、高效的实践。

BEAM: Brainwave Empathy Assessment Model for Early Childhood

本文提出了一种名为 BEAM 的深度学习框架,它通过分析幼儿观看视频时的多视角脑电图(EEG)信号,结合特征融合与对比学习技术,实现了对儿童共情水平(表现为助人意愿)的客观、准确预测。