MoRSE:耶鲁破解多Agent同质化,以双层混合专家实现参数特化
针对这一瓶颈,耶鲁大学的研究团队提出了名为 MoRSE (Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts)的新型多智能体框架。
针对这一瓶颈,耶鲁大学的研究团队提出了名为 MoRSE (Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts)的新型多智能体框架。
RealisticTritonBench:实验结果给大模型在底层系统优化上的应用浇了一盆冷水:即使是当前最顶尖的推理与代码模型,在真实系统环境下的综合任务成功率最高也仅有 25.81%,全模型平均成功率低至 18.71%。
基于此,研究团队提出了 PowerSlider 运行时系统,通过将流水线解耦为 Prefill-Think-Answer 三阶段、引入带容忍裕度的 Flex SLO 契约,并借助极速 KKT 在线求解器在毫秒级内完成功率重分配,彻底打破了电网限电与服务质量不可兼得的死结。
近期开源的学术检索基础设施 AskChem 提出了一个根本性的转变方案:彻底打破以整篇论文为基本检索单元的传统做法,转而将承载可溯源信息的“原子化科学断言”(Provenance-carrying Claim)作为核心对象。
针对这一系统瓶颈,东北大学(Northeastern University)的研究团队提出了 InferScale 。InferScale 抛弃了在文本层(Token Layer)机械拼接记忆的做法,改为直接在注意力层(Attention Layer)进行原生 KV 注入(KV Injecti...
来自 IBM Research 的研究者在论文《Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization》中提出了一个反直觉的疑问: 我们真的必须在目标模型上运行整个搜...
来自马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在论文《Kalypso: Relational LLM Serving》中提出了破局方案。该研究定义了“关系型 LLM 推理”(Relational LLM Serving)这一全新抽象层,并构建了名为 Kalypso 的执行系统。
为了穿透这种“正确性的幻觉”,两位研究者提出了一套契约级验证器(Contract-Grade Verifier),并设定了 12 道对抗性的测试门禁。当这套工具对准知名开源体系 Dr. Kernel / KernelGYM 中已被官方测试判定为完全正确的 2,638 个 Triton 算子时。
这篇综述对当前 GUI Agent 的评测生态提出了极其犀利的批评:当前的论文看起来指标飞涨,但测试结论往往无法转化为真实可用性。最核心的问题在于 评测指标过度聚焦于单一的“任务成功率”(Task Success Rate) 。
为了打破这一困局,研究团队提出了首个 AI 原生、安全且自主的攻防共进化系统 SysEvolve 。该系统通过协同设计的靶场平台 SysField 、自主攻击系统 SysSpear 和实时防御系统 SysArmor ,让红蓝双方 AI Agent 在受控的高仿真多主机环境中展开博弈,实现双向自...
为了攻克这道工程与算法的双重难关,蚂蚁集团(Ant Group)联合清华大学提出了名为 Realtime-Venus 的前沿全双工交互系统。该系统基于 9B 参数规模。
近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统的拓扑图和提示词本身作为可学习、可演化的程序状态,通过从线上运行轨迹中提炼可...
为了打破单次判决的局限,来自南京大学、南洋理工大学与新加坡管理大学的研究团队提出了 AgentAntibody 。该工作借鉴生物学中的自适应免疫系统(Adaptive Immune System),首次为大模型智能体建立了一套不依赖模型微调、跨任务持续演进的运行时免疫记忆。
与以往只在玩具数据集或单机沙盒中跑代码的 Agent 不同,RecEvolve 直接接入了分布式仓储计算集群与生产级版本控制系统,端到端接管了“提出假设、编写代码、拉起分布式训练、指标评估到沉淀经验”的完整研发闭环。
为彻底解决这一问题,ABot-World-0 提出了核心训练创新—— LongForcing 。LongForcing 的本质是在更长的时序跨度上,对 Student 自身的长程自推演轨迹(Self-rollouts)施加分布级监督。
该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提炼出由 193 项硬性工程实践与 13 个前沿课题构成的 206 项系统可靠...
- 状态构建(State Construction) :在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
由 Scale AI、加州大学圣克鲁兹分校(UC Santa Cruz)与范德堡大学医学中心(Vanderbilt University Medical Center)联合提出的 READY (Reliable Enterprise Agent Deployment)框架,正是为了破解这个断层。
随着大语言模型(LLM)推理架构的迅猛迭代,解码速度正在被各大服务框架推向极限。无论是专用硬件加速还是投机采样(SpeculativeDecoding),模型输出Token的时间开销已被大幅压缩。然而,在以自主代码编写、系统运维和自动化交互为代表的Agent任务中,用户的真实体感并没有成比例变快。
在大模型落地实际任务的过程中,如何赋予模型稳定的“专业技能”,始终面临着一个两难困境。最符合人类直觉的方式是将操作流程写成提示词(TextSkill),这种做法灵活、易读且即插即用,但模型在实际推理时往往难以稳定遵循复杂的文字指令;另一种极端则是通过全量微调或LoRA将技能固化到模型权重中,这...
现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科学发现的爆发。
在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContextProtocol(MCP)为代表的标准化协议,将文件操作、代码执行、网络抓...
在过去几年中,利用大型语言模型(Agent)来编写和优化底层GPU代码(Kernel)成为了提升AI计算效率的热门路径。然而,当前的大部分尝试都面临着一个难以逾越的瓶颈:Agent通常将编译器视为一个僵化的黑盒。它们提交代码、等待编译、运行测试,最后只能获得一个冰冷的报错信息或一个总体的执行延...
形式化方法一直被视为软件工程领域对抗复杂系统缺陷的终极武器。对于分布式架构和高并发系统而言,多线程交织调度和网络消息传递的非确定性,使得系统状态空间呈现指数级爆炸。