**TokTier:精确状态感知分词机制,Agent场景提速491倍!**
在当前的大语言模型服务架构中,前缀缓存(PrefixCaching或KVCache)已经成为降低推理延迟的标配。当模型处理多轮对话或长上下文时,前缀缓存能够有效复用已经计算过的状态,避免重复的预填充(Prefill)计算。
在当前的大语言模型服务架构中,前缀缓存(PrefixCaching或KVCache)已经成为降低推理延迟的标配。当模型处理多轮对话或长上下文时,前缀缓存能够有效复用已经计算过的状态,避免重复的预填充(Prefill)计算。
过去一年里,AI在科研领域的应用边界被不断拓宽,从文献检索到辅助实验,甚至是端到端的“AI科学家”框架,都展示了语言模型在科学工作流中的巨大潜力。然而,现有绝大多数自动化研究系统往往在精心挑选的示例、人类限定的主题、预定义的基准测试或是狭窄的任务空间内进行展示。
当前的大模型智能体(Agent)已经展现出令人惊叹的单点任务解决能力。面对复杂的指令,它们能够自主调用工具、反思错误,并通过与环境的不断交互找到破局之道。然而,这种成功往往是高度脆弱且孤立的。
随着大语言模型驱动的智能体(Agent)从执行简单的单次工具调用,逐步演进为能够自主执行复杂长周期任务的系统,Agent需要掌握的技能数量和种类正在急剧膨胀。为了在真实环境中有效运作,Agent必须从多种来源获取大量可复用的技能。
软件工程的发展史,本质上就是一部关于“复用”(Reuse)的演进史。从早期的复制粘贴代码片段,到引入标准化的库和框架,再到基于云的微服务架构,开发者们一直在寻找更高效的方式来避免重复造轮子。随着生成式AI和自主智能体(AIAgent)的爆发,一种全新的可复用构件正在悄然重塑整个生态——技能(S...
当无数大语言模型驱动的Agent在企业客服、代码生成和数据分析领域遍地开花时,一个致命的系统性瓶颈已悄然浮现。这些Agent虽然具备强大的推理与执行能力,但它们大多是彻头彻尾的“语言孤岛”。不同厂商、不同架构的Agent各自为战,无法顺畅调用外部数据,更难以实现多智能体间的无缝协作。
现在的智能助手越来越懂你,但大多数仍像是在上演现实版《初恋50次》——一旦单次任务结束,上下文清空,所有的用户偏好和任务教训瞬间清零。这种“单次情景”(Episodic)模式确实安全,因为过去是无关紧要的。然而,为了让真正成为得力助手,它们必然要走向“永远在线”的常驻模式。
大模型Agent在应对专业领域的长周期任务时,往往需要依赖提前编写好的“技能”(Skills)——即结构化的操作指南与代码包。然而,真实业务环境是动态的。随着API接口的废弃、边缘场景的涌现,原本完美的技能很快就会退化甚至帮倒忙。让Agent在实战中自我更新技能,是业界公认的解法。
告别手写CUDA噩梦:LLM+Agent自动生成高性能Kernel技术全景。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI当上CUDA工程师:性能超NVIDIA官方库26%,CUDA-L2来了!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
好的,我将遵循您的指示,撰写一份关于该论文的报告。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
结构化智能体软件工程(SASE):基本支柱与研究路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文介绍并验证了一个名为 Chatbot Arena 的开放平台,该平台通过众包用户的成对比较和偏好投票,来评估和排名大型语言模型(LLM),并为此设计了一套高效、可靠的统计方法论。
本文提出 PagedAttention,一种受操作系统虚拟内存和分页机制启发的注意力算法,通过将键值缓存(KV Cache)划分为非连续的内存块进行管理,解决了大型语言模型(LLM)服务中因内存碎片化和无法共享而导致的效率低下问题,从而在 vLLM 系统中实现了 2-4 倍的吞吐量提升。