基础模型 第4页

提速4.14倍!LoSA破解长文本扩散模型的KV膨胀难题

大语言模型的世界正在悄然发生深刻的变革。传统的自回归生成模式正逐渐显露出其在复杂推理上的局限。块级扩散语言模型(Block-wiseDiffusionLanguageModels,DLMs)异军突起。这种新兴架构允许以任意顺序一次性生成多个Token,展现出极大的灵活性。

牛津大学提出MolJSON:大模型分子推理准确率飙升至98.5%的全新格式

当最先进的大语言模型试图解开复杂化学反应的奥秘时,它们却经常在最基础的环节栽跟头。为什么一个能写出完美代码的AI,却连简单的环状分子结构都容易认错?该研究指出,罪魁祸首并非模型本身的推理能力不足,而是我们给模型喂入数据的“方言”不对。长期以来,化学界习惯使用现成的文本格式来表示分子结构。

多智能体AI创造力碾压人类团队?1.5倍断层优势与语义轨迹揭秘

长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。

Nemotron 3 Super开源:提速7.5倍的120B混合架构MoE解读

大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...

赋予Agent“变通”智慧:PAVE架构让AI火灾违规逃生率达81%

当一辆由大语言模型控制的自动驾驶汽车遇到严重火灾,而正前方却亮着红灯时,它该怎么做?是违规闯红灯以求生存,还是死板地遵守交通规则等待救援?传统的生成式智能体(GenerativeAgents)在模拟人类合作行为时表现优异。但在面临生存与规则冲突的复杂决策时,它们往往显得异常死板。

PEEK:为大模型Agent装上“上下文地图”,长文本成本直降5.8倍

当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索...

迈向L5级智能:清华华为等九大机构联合定义个人LLM Agent

今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。

Agent脚手架自进化:GSME框架破解评估噪音,冻结模型性能暴涨15.5%

在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一...

SkillComposer:Agent技能自我进化,跨级提升模型4.5分

在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。

大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南

如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。

告别Token依赖!清华与NUS联合揭秘大模型隐空间,盘点4大机制与7大能力

现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。

WebShaper:集合论重构数据合成,打造最强开源搜索Agent

OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。

A model of errors in transformers

DeepMind重磅:仅需2个参数,精准预测LLM错误率!物理学“有效场论”立大功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Accurate Table Question Answering with Accessible LLMs

Qwen-14B逼近GPT-4!Orchestra多智能体架构让开源模型制霸表格问答。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Deep Delta Learning

超越ResNet!普林斯顿Deep Delta Learning:让神经网络学会“遗忘”与“反思”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。