8B小模型单挑120B大厂基线!HASE框架让AI学会自我重构与环境演化
为什么仅有80亿参数的小模型,能够在极其复杂的代码生成任务中,击败1200亿参数的巨头大模型?当常规的AI系统都在绞尽脑汁地优化“如何解答问题”时,一项前沿研究揭示了降维打击的秘密。那就是:直接赋予模型“修改考卷”和“重构考场”的超级权力。
为什么仅有80亿参数的小模型,能够在极其复杂的代码生成任务中,击败1200亿参数的巨头大模型?当常规的AI系统都在绞尽脑汁地优化“如何解答问题”时,一项前沿研究揭示了降维打击的秘密。那就是:直接赋予模型“修改考卷”和“重构考场”的超级权力。
随着上下文窗口越来越长,大模型在长周期任务中依然常常迷失。它们要么被历史交互中堆积如山的无效信息淹没,要么陷入死循环,疯狂消耗宝贵的API额度。过去,为了解决这个问题,开发者们通常会手写一套复杂的脚手架(Harness)代码。这些脚手架负责截断上下文、重试错误、解析输出。
目前开发AIAgent,最痛苦的环节莫过于“手搓”外挂代码。换个新模型,提示词模板可能得全部重写。加个新工具,原本顺畅的控制流直接崩溃。大量在运行中产生的报错记录和轨迹,最后只能被当成垃圾数据扔掉。究竟有没有一种方法,能让Agent的运行框架自己学习、自己修改代码?
在代码大模型领域,长期存在着一条隐形的界线。一边是按部就班的工作流方法,另一边是自由探索的智能体框架。难道鱼与熊掌真的不可兼得?本文提出的Kimi-Dev给出否定答案。该研究在SWE-benchVerified榜单上拿下60.4%的准确率。近年来,大语言模型在自动化软件工程领域的应用日益广泛。
大语言模型正经历从静态模仿向主动交互的深刻变革。这标志着智能体(AgenticIntelligence)时代的全面开启。在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。
在实际的业务落地中,大型语言模型面对复杂任务常显力不从心。为了提升性能,开发者往往会引入具备工具调用能力的智能体。然而,智能体的算力成本和推理延迟往往让人望而却步。事实上,许多基础查询完全在轻量级模型的原生能力边界之内。它们根本不需要启动完整的智能体执行流。近期,多所顶尖高校联合提出了一项名为...
现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。
Agent在处理长线任务时,往往深深受困于记忆系统的技术瓶颈。目前主流的记忆架构,普遍面临着一个极为尴尬的“两难困境”。传统基于向量检索的系统响应极快,但极其容易召回大量无关的错误噪声。如果直接让超大参数模型接管记忆操作,检索的准确率虽然有所提升。但随之而来的是难以忍受的累积延迟,以及极其高昂...
当人工智能在棋盘上击败人类顶尖棋手时,世界曾为之惊叹。但那往往依赖于封闭规则下的海量自我博弈与搜索计算。如今,大模型正步入更加复杂、充满未知与博弈的真实交互场景。它们不再仅仅是回答常识问题或进行基础的代码编写。它们开始需要预测多方意图、制定长远计谋并动态调整策略。
当前主流的Agent框架几乎都遵循同一个默认设定:让大语言模型担任核心调度员。无论是大名鼎鼎的ReAct模式,还是广泛使用的AutoGen或MetaGPT框架。它们都赋予了模型决定下一步调用什么工具、提供什么参数以及何时停止任务的最高权限。在简短的任务或演示中,这种设计显得极其优雅。
评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。
长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。
当前的大语言模型智能体在执行各类复杂任务时,会产生大量高价值的中间轨迹。然而,这些包含丰富过程知识的交互数据,通常在单次使用后就被直接丢弃。或者仅被生产该轨迹的单一智能体私有保留。这种“阅后即焚”的孤岛模式,导致新实例化的智能体被迫反复重新探索已存在的解决方案。
当前沿的大语言模型(LargeLanguageModel,LLM)逐渐进化为能够在复杂环境中执行多轮交互的智能体时,如何高效地将强大“教师”模型的能力蒸馏给小巧的“学生”模型,成为了一个棘手的工程难题。
Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAg...
今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。
大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...
当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。
当前的大语言模型在科研头脑风暴中似乎无所不能,生成候选研究方向往往只需几秒钟。然而,真实的科学研究需要的远不止天马行空的灵感。研究者必须在浩如烟海的文献中精确锚定问题,识别出具有实际意义的技术瓶颈,与现有的解决方案划清界限,并在投入大量算力资源去复现前,严谨地评估潜在风险。
当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。
当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。
在真实世界的部署中,AI智能体往往面临一个尴尬的困境:随着任务越来越复杂,它们急需升级自己的工具库。然而,传统的优化方法大多依赖于带有标准答案的“验证集”。但在实际业务中,收集大量带有真实标签的未来任务数据,既昂贵又极其困难。能否让智能体仅仅通过回顾自己过去的“工作录像”,就能自动发现问题并完...
在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的...
当我们在手机或笔记本电脑等计算资源受限的设备上部署大语言模型时,往往会面临一个根本性的困境:模型的计算效率(即参数量大小)与输出质量之间存在着难以调和的矛盾。小模型(如MobileLLM)虽然运行速度快、成本低,但在复杂任务上往往会出现断崖式的性能下降。