SpecBox:推测式沙箱调度消除冷启动,P99延迟降低2.9倍
在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContex...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContex...
在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-UseAgents,CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一...
现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科...
在大模型迈向“深度研究”(DeepResearch)与复杂自主搜索的浪潮中,长程搜索智能体(Long-HorizonSearchAgent)成了前沿应用的核心。
当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重...
在以大语言模型为核心的智能体(LLMAgent)开发中,持久化层(PersistenceLayer)往往被视作系统工程的基石。无论是人类在回路(Human-in-the-loop)中的审批等待,还是服务器遭遇故障预检、...
在自动驾驶的研究版图中,强化学习(RL)特别是基于多智能体自博弈(Self-play)的方法,一直被视为打破传统离线人类驾驶模仿学习天花板的一把利剑。离线模仿学习极度依赖昂贵的实车采集数据,并且天然受困于协变量偏移(C...
医疗大模型正在经历一场从“做题家”到“执行者”的剧烈转折。在过去两三年里,评估一个医学大模型的水平,主流方法几乎都是给它一张考卷:从美国医师执照考试(USMLE)到各科临床单项选择题,只要模型在问答基准上刷出高分,往往...
赋予大语言模型(LLM)长久记忆,曾被视为智能体(Agent)迈向自主工作的关键一步。从项目代码、用户日常偏好到复杂的跨系统业务流程,记忆模块让智能体告别了“单次对话清零”的局限。
在多轮交互与工具调用的复杂任务中,大语言模型(LLM)Agent经常陷入一种令人沮丧的怪圈:在当前轮次或单次重试中,Agent明明通过反思纠正了错误;但只要开启新任务,面对极其相似的场景,它依然会重蹈覆辙。
在大模型落地实际任务的过程中,如何赋予模型稳定的“专业技能”,始终面临着一个两难困境。最符合人类直觉的方式是将操作流程写成提示词(TextSkill),这种做法灵活、易读且即插即用,但模型在实际推理时往往难以稳定遵循复...
大模型智能体(Agent)一旦部署到复杂的现实或模拟环境中,往往会暴露出各种意料之外的系统性缺陷:工具调用参数写错、环境状态追踪丢失、陷入无效死循环,或者在遭遇异常后彻底无法恢复。
长期以来,人工智能领域对“递归自提升”(RecursiveSelf-Improvement,RSI)的讨论往往停留在理论推演或科幻设想中。如果一个智能系统能够自主改进制造下一代AI的过程,智能的爆发式增长就会成为可能。
绝大多数大语言模型Agent的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。但现实世界中的专业工作流绝非如此。
自AlexNet掀起现代深度学习的浪潮以来,AI领域建立了一条近乎公理的演进路径:端到端(end-to-end)训练总能击败手工切分的分阶段流水线。从早期的图像分类、物体检测,到语义分割与端到端语音识别,凡是允许模型直...
在面向大语言模型(LLM)的智能体强化学习(AgenticRL)研究中,环境交互一直是一道难以逾越的高墙。要让模型学会在复杂的现实任务中连续调用工具、处理报错并达成目标,通常需要让它在成千上万次交互中碰壁摸索。
Deep Agentic Search研究在仓库级代码问答任务中对比向量语义检索和子智能体深层检索。本文解释两种架构的上下文组织、任务交接和成本差异,结合失败案例讨论多层检索的局限;结论不直接推广到所有代码修复任务。
在大语言模型被推向各类专业运维场景的浪潮中,数据库管理员(DBA)往往被视作最适合被AI替代或赋能的岗位之一。近年来,学术界和工业界接连涌现出如D-Bot、DBAIOps、DBAgent等一系列基于大模型的数据库运维智...
在企业和科研机构的实际业务中,当分析师需要计算一份基金风险指标或核对季度供应链数据时,答案几乎从来不会现成地躺在某一张干净的数据库表格里。现实中的核心证据往往支离破碎:计算规则可能写在管理规范的PDF报告中,行业基准可...
大语言模型智能体(LLMAgent)的研究重心,正在从做一道数学题、写一段自洽代码等孤立任务,迅速转向跨越数天乃至数月的真实连续工作流。当任务的生命周期被拉长,上下文窗口的物理上限与持续膨胀的信息量之间产生了不可调和的矛盾。
当多个大语言模型组成多智能体系统(MAS)协同解决复杂任务时,系统崩溃或给出荒谬答案几乎是家常便饭。一个Agent误读了工具输出,或者两个Agent之间产生了理解偏差,错误就会沿着交互链路层层放大,最终导致整个任务彻底失败。
让大语言模型进行“深度研究”(DeepResearch)是当下智能体(Agent)演进的核心方向。但当前的许多研究系统陷入了一个误区:以为把上下文窗口拉长、放开检索步数限制,智能体就能自然找到复杂的最终答案。
随着大语言模型(LLM)推理架构的迅猛迭代,解码速度正在被各大服务框架推向极限。无论是专用硬件加速还是投机采样(SpeculativeDecoding),模型输出Token的时间开销已被大幅压缩。然而,在以自主代码编写...
让机器人学会干活,当前最火的路线莫过于以视觉-语言-动作(VLA)为代表的端到端大模型。将现场摄像头的画面与自然语言任务指令输入进去,神经网络便能直接输出机械臂关节的控制量。