AI工程

Kalypso:打破算子物化壁垒,关系型LLM推理实现4.57倍提速

来自马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在论文《Kalypso: Relational LLM Serving》中提出了破局方案。该研究定义了“关系型 LLM 推理”(Relational LLM Serving)这一全新抽象层,并构建了名为 Kalypso 的执行系统。

EMAS:冻结模型权重自演化Agent,代码准确率达89%且Token降62%

近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统的拓扑图和提示词本身作为可学习、可演化的程序状态,通过从线上运行轨迹中提炼可...

AgentAntibody:不是一刀切拦截,而是赋予智能体自适应免疫力

为了打破单次判决的局限,来自南京大学、南洋理工大学与新加坡管理大学的研究团队提出了 AgentAntibody 。该工作借鉴生物学中的自适应免疫系统(Adaptive Immune System),首次为大模型智能体建立了一套不依赖模型微调、跨任务持续演进的运行时免疫记忆。

代码Agent最新综述!六层依赖链+206项工程可靠性规范

该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提炼出由 193 项硬性工程实践与 13 个前沿课题构成的 206 项系统可靠...

AOSpec:动作与观察协同推测,大模型Agent长尾延迟降低42.8%

随着大语言模型(LLM)推理架构的迅猛迭代,解码速度正在被各大服务框架推向极限。无论是专用硬件加速还是投机采样(SpeculativeDecoding),模型输出Token的时间开销已被大幅压缩。然而,在以自主代码编写、系统运维和自动化交互为代表的Agent任务中,用户的真实体感并没有成比例变快。

KV-Skill:将提示词编译为外挂算子,LiveMath准确率升至77.2%

在大模型落地实际任务的过程中,如何赋予模型稳定的“专业技能”,始终面临着一个两难困境。最符合人类直觉的方式是将操作流程写成提示词(TextSkill),这种做法灵活、易读且即插即用,但模型在实际推理时往往难以稳定遵循复杂的文字指令;另一种极端则是通过全量微调或LoRA将技能固化到模型权重中,这...

SeekBrain:用经验配方库驱动多智能体,神经科学基准超 Claude Code 11.7%

现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科学发现的爆发。

SpecBox:推测式沙箱调度消除冷启动,P99延迟降低2.9倍

在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContextProtocol(MCP)为代表的标准化协议,将文件操作、代码执行、网络抓...

NVIDIA与CMU提出CAKE:Agent与编译器协同设计,前沿Kernel提速2.05倍!

在过去几年中,利用大型语言模型(Agent)来编写和优化底层GPU代码(Kernel)成为了提升AI计算效率的热门路径。然而,当前的大部分尝试都面临着一个难以逾越的瓶颈:Agent通常将编译器视为一个僵化的黑盒。它们提交代码、等待编译、运行测试,最后只能获得一个冰冷的报错信息或一个总体的执行延...

微软Specula:告别人工!自进化AI检出249个系统Bug

形式化方法一直被视为软件工程领域对抗复杂系统缺陷的终极武器。对于分布式架构和高并发系统而言,多线程交织调度和网络消息传递的非确定性,使得系统状态空间呈现指数级爆炸。