最新发布
BRACE:具身智能预算化重规划机制,SLO违规率降至4.7%
在具身智能(EmbodiedAI)的实际部署中,环境始终充满了不确定性。无论是执行过程中的物理偏移、传感器带来的部分可观察性,还是多智能体协同中的突发状况,都迫使智能体必须频繁地进行“重新规划(Replanning)”以纠正错误。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
在具身智能(EmbodiedAI)的实际部署中,环境始终充满了不确定性。无论是执行过程中的物理偏移、传感器带来的部分可观察性,还是多智能体协同中的突发状况,都迫使智能体必须频繁地进行“重新规划(Replanning)”以纠正错误。
PAPER INSIGHTS
让大模型从一个只会聊天的文本生成器,转变为能够解决实际问题的智能体(Agent),其核心跨越在于赋予模型调用外部工具的能力。不论是查询实时搜索引擎、运行Python脚本,还是发送邮件、执行SQL数据库操作,决定“在什么...
科学研究的基石在于可复现性。一个好的科学解释应当能够经受住反复的验证:在相同的实验条件下,应当能得出相同的结果。然而,当代科学特别是机器学习领域,正面临着严峻的“复现危机”。理论上,基于大语言模型(LLM)的智能体有潜...
在过去一年里,具备自主运行能力的网络安全AI智能体(CybersecurityAgents)在漏洞挖掘和代码审计领域展现出了惊人的进展。然而,这种繁荣很大程度上建立在一个理想化的前提之上:智能体能够直接获取目标软件的源代码。
在长期运行的AIAgent应用中,随着上下文历史不断积累,系统不可避免地会触发记忆压缩机制以适应大语言模型的Token预算限制。然而,现有的工业界压缩策略往往忽视了一个致命问题:一条生死攸关的安全规则和一行无关痛痒的系...
大语言模型(LLM)的训练正在经历一次深刻的范式转移。过去的模型能力提升极度依赖于人类精心构造的高质量数据和海量手工标注,而如今的前沿研究已经将目光投向了由交互驱动的“自我进化”(Self-Evolution)。在这一...
大模型正从单纯的聊天机器人向能够操作工具、浏览网页和处理文件的AIAgent演进。在这个过程中,提示注入(PromptInjection)成为了横亘在应用落地前的一座大山,并被普遍视为AIAgent面临的首要安全威胁。
当整个行业都在试图通过堆叠激光雷达、深度相机全景阵列甚至预先构建的高精地图来提升机器人的导航成功率时,Mistral团队给出了一个截然不同的答案。他们带来的最新成果RobostralNavigate,不仅是一个拥有80...
在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者...
在构建和部署大语言模型智能体(Agent)系统时,开发者往往依赖一个核心假设:当一次智能体会话结束时,系统的运行状态会随之清零,或者仅仅保留被显式存入记忆模块的数据。基于这种假设,工具注册表会被清空,事件订阅会过期,中...
在大语言模型(LLM)的后训练阶段,基于强化学习(RL)的对齐技术已经取得了显著的成果。无论是在数学推理、工具调用还是代码生成等单轮交互任务中,标准的“生成-验证-更新”循环都展现出了极高的效率。
在过去几年中,大语言模型的能力边界得到了极大的拓展,但当我们将这些模型构建为复杂的AIAgent时,一个核心瓶颈始终存在:模型本身是没有记忆的。为了解决这个问题,当前的行业标准做法是依赖检索增强生成(RAG)等外部记忆...
随着大语言模型(LLM)能力的跃升,我们对自主智能体(Agent)的期待早已超越了简单的多轮对话或单步问答。如今的Agent被部署在软件工程、科学发现和通用桌面控制等复杂的真实世界场景中,这就要求它们必须具备执行长周期...
随着大模型在复杂软件工程任务中的应用日益深入,针对代码智能体(CodingAgents)的强化学习正在成为前沿焦点。这类智能体在执行任务时,高度依赖长时间运行的智能体脚手架(AgentHarnesses)来管理工具集成...
当前的自动化科学发现正在向“第五范式”迈进,即依赖自动驾驶实验室(Self-drivinglaboratories,SDLs)通过机器人实现高通量实验。然而,在这个看似前沿的领域中,存在一个极为底层的痛点:绝大多数湿实...
工业界对“AI程序员”的期望已经从单纯的代码补全,升级到了能够直接读取Bug报告、克隆仓库并独立提交正确补丁的端到端修复。在这个背景下,SWE-bench成为了衡量大模型软件工程能力的试金石。
大语言模型智能体正在以前所未有的速度深入企业核心业务流。在真实的生产环境中,它们的部署模式通常遵循一种默认的“长期指令”架构:开发者会将一份系统提示词、一份企业合规文件或是一份厚厚的技能说明书塞进模型的上下文窗口中,并...
大语言模型(LLM)本身并不等同于一个真正可运行的智能体(Agent)。决定Agent最终能力边界的,不仅是底层的神经网络权重,更是包裹在模型外围的“控制程序(Harness)”——这套可执行代码负责构建多轮上下文、精...
在大语言模型(LLM)逐渐从单轮问答转向执行长期复杂任务(如仓库级软件工程、开放网络深度研究)的今天,智能体(Agent)面临着一个不可回避的物理瓶颈:随着交互轮次、工具调用和观察结果的不断累积,会话历史的长度将不可避...
随着OpenAIOperator和Anthropic计算机使用(ComputerUse)API的相继发布,能够直接操作网页和软件的计算机智能体(Computer-UseAgents)正迅速从实验室原型走向大规模商用。
在过去几年中,利用大型语言模型(Agent)来编写和优化底层GPU代码(Kernel)成为了提升AI计算效率的热门路径。然而,当前的大部分尝试都面临着一个难以逾越的瓶颈:Agent通常将编译器视为一个僵化的黑盒。它们提...
硬件算子(HardwareKernel)的优化一直是一项高度依赖专家经验的密集型工程。为了充分榨取硬件性能,工程师需要综合考虑目标设备的内存层次结构、数据搬移策略、并行执行机制以及特定的硬件约束。每一次优化尝试,都必须...