北航ExeCRE:以执行一致性建模可靠度,误导反馈从113例降至14例
针对执行引导自纠错中的信任危机,来自北京航空航天大学的研究团队提出了 ExeCRE(Execution-Consistency guided code Reliability Estimation)框架。
针对执行引导自纠错中的信任危机,来自北京航空航天大学的研究团队提出了 ExeCRE(Execution-Consistency guided code Reliability Estimation)框架。
来自四川大学的研究团队提出了 RA-CAD (ReAct Agent for CAD),从根本上重构了这一范式:研究者不再把执行后审查当成孤立的外部提示,而是将其拆解为智能体策略内部的显式决策动作,通过两阶段优化(CCB 与 FAO)让大模型在同一个交互轨迹中协同进化代码生成能力与自我审查能力。
由腾讯、上海交通大学与香港城市大学联合提出的 SeqLLM 框架直面这一核心矛盾。该研究并不依赖传统“先破坏、再修复”的持续预训练加蒸馏路径,而是通过紧凑的离散字段级词表、文本接地的轻量投影器以及 前缀引导能力注入(Prefix-Guided SFT) 机制。
来自英国牛津大学、美国普林斯顿大学、麻省理工学院、法国国家信息与自动化研究所(Inria)等多家顶级科研机构的研究团队,针对这一长期被忽视的盲区提出了全新基准: DiG-bench (Discovery in Games)。
实验结果清晰地绘制出了适用边界: 在以深度因果与复杂推导为特征的 BRIGHT 基准上,单靠强向量模型第一阶段只能拿到 22.3 的 nDCG@10;而一旦在后端引入 LLM 列表重排,最终得分直接跃升至 35.1。
面对这一瓶颈,来自 Meta FAIR、牛津大学以及伦敦大学学院(UCL)的研究团队提出了一个极具针对性的解法: AI 研究偏好模型 (AI Research Preference Models,简称 RPM )。他们没有继续卷代码生成能力,而是将核心突破口放在了“实验筛选决策”上。
他们提出了针对材料科学的 Auto Research 工作流,设定了极其苛刻的审计红线: 严格隔离搜索与最终评估,将搜索空间解耦为四大干预维度,并将最终选定的代码完全“冻结”,送入绝对不可见的保留测试集(Hold-out Test)中进行盲测 。
然而,来自 IBM、MIT 和 UC Berkeley 的联合研究团队在最新论文中提出了一个尖锐的问题:那些宣称性能卓越的复杂框架,究竟是在通用机制上真正带来了质的飞跃,还是仅仅在极少数偶然的“高光运行”(Lucky runs)中撞上了好运气?
为了打破这种“前端精挑细选、后端全量硬吃”的割裂状态,来自 QiYuanLab 与北京科技大学的研究团队提出了 KAP (Knowledge Access Planning,知识访问规划)。
为此,XL-DocBench 提出了一套“树引导的由粗到细构建框架”(Tree-Guided Coarse-to-Fine Construction Protocol),在模型自动化提议与人工专业核验之间建立起清晰的分工管线。
来自卡耐基梅隆大学(Carnegie Mellon University)的研究团队提出了 框架,在保留大型预训练主干、多模态表达力与动作分块优势的前提下,通过“快慢感知解耦”与“自适应单步去噪调度”,打破了高延迟与低响应度之间的恶性循环。
针对这一困局,来自工业界的研究团队提出了全新审查系统 ARCTIC 。这项工作的核心立意,是将以往针对语法和样式的机械式“代码审查”(Code Review),重构为面向全局架构与关键风险的“代码批判”(Code Critique)。
针对这一核心冲突,最新研究提出了 SG-WAM (Self-Guided World Action Model)。该框架摒弃了繁重的未来像素生成,也不引入外部异构的未来表征编码器,而是直接在策略自身的表征空间内建立动力学预测。
为了打破这一僵局,研究团队提出了 WaiT (Wavelet-aware image Transformer)。其核心思想异常直观而精妙:名副其实地“等待信号”(Wait for the Signal)。通过可逆且无损的离散小波变换(Haar DWT),WaiT 将生成过程在频域上解耦为低频粗...
结果表明,四项在当今主流开源模型(如 Llama、Qwen、Olmo)中极度普遍的细微架构改动,存在极其致命的负向复合效应。单独看其中任何一项改动,对长上下文能力的损害都轻微到容易被当成实验噪声;但一旦同时引入三项或全部四项,模型在长文本下游任务(HELMET 基准)中的表现会直接暴跌多达 47%。
来自约翰斯·霍普金斯大学、微软研究院(Microsoft AI Frontiers)与普林斯顿大学的研究团队,在最新论文中直击这一结构性缺陷,提出了 Full-bandwidth Transformer 。
本文提出了 轨迹后门攻击 ( Trajectory Backdoor Attack ,简称 TBA )。在完全无需触碰技能代码、没有任何提权行为,甚至仅拥有普通用户提问权限(Query-only)的前提下,攻击者只需巧妙设计正常的任务 Prompt,诱导智能体在执行过程中暴露出特定的行为证据链。
由微软研究院、英伟达、纽约大学、普林斯顿大学与耶鲁大学等机构联合提出的 Dion3,正是针对这一系列系统与算法痛点交出的全栈答案。Dion3 从底层硬件算子、数学算法重构、优化器更新机制到分布式通信策略进行了彻底改造,将 Muon 正交化步骤的耗时全面压低。
针对这一断层,新研究提出了首个从单张静态插画直接端到端生成完整可驱动 Live2D 资产的系统 Bunraku。该系统的命名源于日本传统木偶净瑠璃(Bunraku),寓意多个操作者在统一的节奏下协同牵引同一个木偶。
为了打破这一困局,研究团队将技能进化重构为一个在探索与利用之间寻找平衡的受限马尔可夫决策过程(MDP),并提出了全新的进化框架 SkillBoost 。在涵盖复杂代码生成、多轮工具调用、高难度数学推理、具身交互及多模态文档问答等 23 个模型与基准配置的严苛测试中。
针对这一根本性瓶颈,来自苏黎世联邦理工学院(ETH Zurich)、斯坦福大学、Google、伊利诺伊大学厄巴纳-香槟分校等机构的研究团队提出了 TimeRLM 。
为了破解这一痛点,浙江大学的研究者们提出了 SkillAligner 。它的核心观点非常清晰: 在 Agent 执行任务前,绝不能把检索到的外部技能当成不容置疑的硬性指令,而应当将其视作“可以随意修改的底稿”(Adaptable Drafts) 。
针对这一长期困扰异构通信的核心冲突,研究团队提出了名为 XBridge 的免解码(Decode-free)通信协议。该方案将通信解构为离散实体锚点与连续上下文增强两个独立通道,在三大开源模型家族(Llama、Qwen、Mistral)与七大复杂基准测试中,不仅将通信延迟缩减了整整 11 倍。
复旦大学与上海市数据科学重点实验室的研究团队提出了名为 HarnessLens 的自演进框架。该框架打破了传统自优化方案“大水漫灌”式的评测逻辑,提出以“行为感知验证”(Behavior-Aware Verification)与“可归因证据门控”(Attributable-Evidence G...