基础模型

RA-CAD:把代码审查做成内生策略,参数化CAD不可执行率降至6.2%

来自四川大学的研究团队提出了 RA-CAD (ReAct Agent for CAD),从根本上重构了这一范式:研究者不再把执行后审查当成孤立的外部提示,而是将其拆解为智能体策略内部的显式决策动作,通过两阶段优化(CCB 与 FAO)让大模型在同一个交互轨迹中协同进化代码生成能力与自我审查能力。

SeqLLM:微信支付风控落地,大模型如何兼顾序列建模与语言能力?

由腾讯、上海交通大学与香港城市大学联合提出的 SeqLLM 框架直面这一核心矛盾。该研究并不依赖传统“先破坏、再修复”的持续预训练加蒸馏路径,而是通过紧凑的离散字段级词表、文本接地的轻量投影器以及 前缀引导能力注入(Prefix-Guided SFT) 机制。

高出0.4分却贵了1431倍!大模型真能取代Embedding吗?

实验结果清晰地绘制出了适用边界: 在以深度因果与复杂推导为特征的 BRIGHT 基准上,单靠强向量模型第一阶段只能拿到 22.3 的 nDCG@10;而一旦在后端引入 LLM 列表重排,最终得分直接跃升至 35.1。

RPM:Meta让AI研究员学会“挑实验”,节省超1/3算力且刷新两项SOTA

面对这一瓶颈,来自 Meta FAIR、牛津大学以及伦敦大学学院(UCL)的研究团队提出了一个极具针对性的解法: AI 研究偏好模型 (AI Research Preference Models,简称 RPM )。他们没有继续卷代码生成能力,而是将核心突破口放在了“实验筛选决策”上。

ARCTIC:从逐行审查到代码批判,漂移检测让失准再降5.76分

针对这一困局,来自工业界的研究团队提出了全新审查系统 ARCTIC 。这项工作的核心立意,是将以往针对语法和样式的机械式“代码审查”(Code Review),重构为面向全局架构与关键风险的“代码批判”(Code Critique)。

WaiT:让高频先等等!Meta频域流匹配算力减半创下像素SOTA

为了打破这一僵局,研究团队提出了 WaiT (Wavelet-aware image Transformer)。其核心思想异常直观而精妙:名副其实地“等待信号”(Wait for the Signal)。通过可逆且无损的离散小波变换(Haar DWT),WaiT 将生成过程在频域上解耦为低频粗...

微小架构改动让长文本暴跌47%!AI2烧了17万卡时挖出底层隐患

结果表明,四项在当今主流开源模型(如 Llama、Qwen、Olmo)中极度普遍的细微架构改动,存在极其致命的负向复合效应。单独看其中任何一项改动,对长上下文能力的损害都轻微到容易被当成实验噪声;但一旦同时引入三项或全部四项,模型在长文本下游任务(HELMET 基准)中的表现会直接暴跌多达 47%。

TBA:无需写权限,仅凭Query诱导轨迹逼近直接后门注入

本文提出了 轨迹后门攻击 ( Trajectory Backdoor Attack ,简称 TBA )。在完全无需触碰技能代码、没有任何提权行为,甚至仅拥有普通用户提问权限(Query-only)的前提下,攻击者只需巧妙设计正常的任务 Prompt,诱导智能体在执行过程中暴露出特定的行为证据链。

Dion3:全栈重构Muon正交更新,单步开销缩减至AdamW的4倍

由微软研究院、英伟达、纽约大学、普林斯顿大学与耶鲁大学等机构联合提出的 Dion3,正是针对这一系列系统与算法痛点交出的全栈答案。Dion3 从底层硬件算子、数学算法重构、优化器更新机制到分布式通信策略进行了彻底改造,将 Muon 正交化步骤的耗时全面压低。

阿里浙大提出SkillBoost:三阶段受限搜索,让技能泛化差近乎归零

为了打破这一困局,研究团队将技能进化重构为一个在探索与利用之间寻找平衡的受限马尔可夫决策过程(MDP),并提出了全新的进化框架 SkillBoost 。在涵盖复杂代码生成、多轮工具调用、高难度数学推理、具身交互及多模态文档问答等 23 个模型与基准配置的严苛测试中。

浙大SkillAligner:把检索技能当草稿,破解Agent失配且降本38%

为了破解这一痛点,浙江大学的研究者们提出了 SkillAligner 。它的核心观点非常清晰: 在 Agent 执行任务前,绝不能把检索到的外部技能当成不容置疑的硬性指令,而应当将其视作“可以随意修改的底稿”(Adaptable Drafts) 。

XBridge:破解异构模型通信瓶颈,延迟降低11倍且全面超越文本交互

针对这一长期困扰异构通信的核心冲突,研究团队提出了名为 XBridge 的免解码(Decode-free)通信协议。该方案将通信解构为离散实体锚点与连续上下文增强两个独立通道,在三大开源模型家族(Llama、Qwen、Mistral)与七大复杂基准测试中,不仅将通信延迟缩减了整整 11 倍。