-
Jailbroken: How Does LLM Safety Training Fail?
本文提出并验证了大型语言模型(LLM)安全训练的两种核心失败模式——“竞争性目标”与“泛化不匹配”,并基于此设计出能成功“越狱”(Jailbreak)GPT-4和Claude等顶尖模型的新型攻击方法。
-
Jailbreaking Black Box Large Language Models in Twenty Queries
本文提出了一种名为 PAIR 的黑盒攻击算法,其利用一个攻击者大语言模型 (LLM),通过少量(通常少于20次)的查询,以自动化、迭代的方式生成并优化具有语义的提示(Prompt),从而高效地“越狱”目标 LLM。
-
iTransformer: Inverted Transformers Are Effective for Time Series Forecasting
本文提出iTransformer,通过将Transformer的输入维度进行“反转”,即视每个单独的时间序列变量为一个独立的Token,从而使自注意力机制能够有效捕捉多变量间的相关性,而前馈网络则用于学习每个序列的非线性表示,最终显著提升了时间序列预测的性能和泛化能力。
-
Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation
本文提出了一个名为 EvalPlus 的代码合成评估框架,通过大规模自动生成测试用例(结合 LLM 和变异测试策略)来严格评估大语言模型(LLM)生成代码的真实功能正确性,揭示了现有基准(如 HumanEval)因测试不足而严重高估了模型的性能。
-
Is ChatGPT a General-Purpose Natural Language Processing Task Solver?
本文通过在覆盖7大类任务的20个NLP数据集上进行全面的零样本(zero-shot)评估,系统性地剖析了ChatGPT作为通用自然语言处理任务解决器的能力,发现其在推理密集型任务上表现出色,但在序列标注等特定任务上仍面临挑战,且综合性能通常不及为特定任务微调的模型。
-
Introduction to Machine Learning
本文是一部综合性的教科书或讲义,旨在介绍机器学习领域的数学基础和核心技术。其内容组织体现了对该领域的系统性分类。
-
Internalizing World Models via Self-Play Finetuning for Agentic RL
本文提出了一种名为 SPA (Self Play Agent) 的智能体强化学习框架,它通过自我博弈(Self-Play)有监督微调(SFT),让大语言模型智能体在策略优化前先内化一个世界模型(World Model),从而显著提升其在分布外(OOD)环境中的学习性能和泛化能力。
-
Inter-Agent Trust Models: A Comparative Study of Brief, Claim, Proof, Stake, Reputation and Constraint in Agentic Web Protocol Design-A2A, AP2, ERC-8004, and Beyond
智能体间信任模型:Brief、Claim、Proof、Stake、Reputation 和 Constraint 在智能体网络协议设计中的比较研究。
-
Intelligence per Watt: Measuring Intelligence Efficiency of Local AI
AI算力新范式:斯坦福提出“每瓦特智能”,本地模型能效两年提升5.3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
本文提出了InstructBLIP,一个基于预训练模型BLIP-2的视觉语言指令微调框架,通过引入一个创新的指令感知查询转换器(Q-Former),使模型能根据文本指令提取相应的视觉特征,从而在广泛的未见过的视觉语言任务上实现了最先进的零样本(zero-shot)泛化能力。
-
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
本文提出了一种名为 IGPO (Inpainting-Guided Policy Optimization) 的强化学习框架,它利用扩散大语言模型 (dLLM) 独特的“填补” (inpainting) 能力,通过在探索过程中策略性地注入部分真实推理线索,从而有效解决强化学习中的探索效率低下和零优势困境问题。
-
Inefficiencies of Meta Agents for Agent Design
本文通过实验揭示了一类流行的元智能体(meta-agent)在自动化智能体设计中存在的三个核心问题:学习效率低下、生成的智能体多样性不足以及经济可行性有限,并发现进化式上下文策展策略可以有效提升性能。
-
Increasing the Thinking Budget is Not All You Need
思考预算并非万能:揭秘让大模型更聪明的“性价比”策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
告别思维混乱:自重写技术让LLM推理长度锐减46%,质量反而更高。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
In-Context Distillation with Self-Consistency Cascades: A Simple, Training-Free Way to Reduce LLM Agent Costs
Agent推理成本降低2.5倍:斯坦福提出“上下文蒸馏”,免训练让小模型偷师大模型。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Improving Recursive Transformers with Mixture of LoRAs
小模型逆袭:MoL让1.2亿参数ModernALBERT超越全参数基线。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Improving Online Algorithms via ML Predictions
本文提出了一种利用机器学习(ML)预测来改进在线算法性能的理论框架,设计的算法在预测准确时性能接近最优(一致性),在预测错误时性能也不会大幅下降,可优雅地退化到经典在线算法的水平(鲁棒性)。
-
Improving Context Fidelity via Native Retrieval-Augmented Reasoning
本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。
-
Improved Baselines with Visual Instruction Tuning
本文通过对LLaVA框架进行简单而有效的改进,即采用MLP视觉-语言连接器、引入带有响应格式化提示的学术VQA数据等,构建了LLaVA-1.5,一个在11个基准上达到SOTA、同时保持极高数据和计算效率的大型多模态模型基线。
-
Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
本文通过实验证明,在大型语言模型 (LLM) 的多任务强化学习 (RL) 后训练中,不同任务会产生幅度差异悬殊的梯度,并且大梯度并不意味着大的学习增益,这种梯度不平衡现象会导致优化过程偏向特定任务,从而损害整体性能。
-
ImageBind: One Embedding Space To Bind Them All
本文提出 ImageBind,一种仅通过将图像与其他多种模态(文本、音频、深度、热成像、IMU)的数据进行配对,就能学习到一个统一的多模态联合嵌入空间,并由此涌现出跨模态对齐与组合等新能力的方法。
-
HunyuanVideo 1.5 Technical Report
83亿参数新SOTA!混元Video 1.5开源,推理加速87%,RTX 4090轻松跑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
HPLT 3.0: Very Large-Scale Multilingual Resources for LLM and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
本文发布了HPLT 3.0,一个包含近200种语言、总量达30万亿token的开源、大规模、高质量多语言文本数据集,并提供了完整的开源数据处理流程、多语言评估框架及预训练模型,旨在推动LLM和MT研究的普及化。
-
How Far Are We from Genuinely Useful Deep Research Agents?
千份报告揭示AI研究助手致命弱点:OPPO发布FINDER基准与DEFT分类法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
RL训练的秘密:LLM学会了举一反三,为何却被“先易后难”的结构卡住?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns
SFT正在“毁掉”泛化能力?5大原子技能揭示RL为何是推理的未来。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
准确率飙升至91%!Hindsight:让20B模型记忆力超越GPT-4o。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Higher-order Linear Attention
本文提出了一种名为高阶线性注意力 (Higher-order Linear Attention, HLA) 的新型注意力机制,它通过紧凑的前缀充分统计量 (prefix sufficient statistics) 实现了高阶交互,同时保持了线性时间复杂度和流式计算能力,从而在不牺牲表达能力的情况下解决了标。
-
Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task
本文通过强化学习训练Transformer执行排序任务,发现更高的嵌入维度能促使智能体形成更可靠、更具可解释性的内部世界模型,即便任务准确率早已饱和。
-
HiFi-RAG: Hierarchical Content Filtering and Two-Pass Generation for Open-Domain RAG
NeurIPS 2025冠军:Google HiFi-RAG如何用分层过滤让RAG性能暴涨19%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
本文提出了一个名为HEAL的新型评估框架,它将大语言模型的偏好对齐问题重新定义为在“假设空间”内的重排序过程,并通过排序准确性和偏好强度相关性两个新指标,更全面地分析现有偏好学习方法。
-
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
本文提出了一种名为熵调制策略梯度 (Entropy-Modulated Policy Gradients, EMPG) 的框架,通过利用智能体在长时程任务中每一步的内在不确定性(熵)来动态调整策略梯度,从而有效解决了稀疏奖励下的信用分配难题,显著提升了大型语言模型(LLM)智能体的学习效率和最终性能。
-
Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond
本文是一份面向实践者和终端用户的综合性实践指南,围绕模型、数据和下游任务三个维度,深入探讨了如何有效利用大型语言模型(LLMs)解决自然语言处理(NLP)问题,并详细剖析了不同场景下选择LLMs或微调模型的利弊。
-
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
本文提出了HarmBench,一个用于自动化红队攻防的标准化评估框架,并通过大规模实验揭示了当前攻防方法的局限性,同时提出了一种高效的对抗训练方法R2D2,显著提升了大型语言模型的安全鲁棒性。
-
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
AI Agent记忆也“幻觉”?HaluMem:首个记忆系统“CT扫描”基准,精准定位错误根源。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
HAD: HAllucination Detection Language Models Based on a Comprehensive Hallucination Taxonomy
本文提出了一个全面的幻觉分类体系,并基于此构建了一个大规模合成数据集,用以训练 模型,使其能够在一个统一的推理过程中完成幻觉分类、范围识别和内容纠正。
-
GUI-360: A Comprehensive Dataset and Benchmark for Computer-Using Agents
本文提出 GUI-360,一个用于推进桌面级计算机使用智能体(CUA)的大规模、综合性数据集与基准测试套件,它通过一个由 LLM 增强的高度自动化流程构建,旨在解决真实世界任务稀缺、数据收集标注困难、以及缺乏统一基准的三大挑战。
-
Graph of Thoughts: Solving Elaborate Problems with Large Language Models
本文提出了一种名为“思想图谱 (Graph of Thoughts, GoT)”的新型提示框架,通过将大型语言模型 (LLM) 的思维过程建模为任意图结构,其中“思想”是节点,依赖关系是边,从而实现了超越链式或树状思维模式的、更复杂和强大的推理能力,尤其擅长聚合多个推理路径以生成协同的、更高质量的解决方案。
-
GPT-4o System Card
本文发布了GPT-4o,一个端到端训练的原生多模态(omni)模型,该模型能够统一处理和生成文本、音频、图像的任意组合,并详细介绍了其在新能力(特别是实时语音交互)下的安全评估体系、风险缓解措施及其潜在的社会影响。
-
GPT-4 Technical Report
本文介绍了一个大规模、多模态模型GPT-4,它能够接收图像和文本输入并生成文本输出,在多项专业和学术基准上展现出与人类相当的性能,并通过可预测的扩展方法实现了其性能的精准预测。
-
GPQA: A Graduate-Level Google-Proof Q&A Benchmark
本文提出了 GPQA,一个包含448道由生物、物理和化学领域专家编写的研究生水平多项选择题数据集,其设计目标是“防谷歌化”(Google-Proof),即对于拥有不受限制网络访问权限的熟练非专家来说也极其困难,旨在为未来超人AI系统的可扩展监督(scalable oversight)研究提供一个极具挑战性的。
-
GoAgent: Group-of-Agents Communication Topology Generation for LLM-based Multi-Agent Systems
GoAgent:让AI Agent学会“抱团”,准确率93.8%,Token成本降低17%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Geometric and Dynamic Scaling in Deep Transformers
Transformer 越深越“傻”?几何视角揭秘百层大模型坍塌之谜。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era
生成式模型用于合成数据:在GenAI时代变革数据挖掘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Generative Early Stage Ranking
Meta重塑推荐系统:GESR用“混合注意力”打破双塔模型瓶颈,性能大涨延迟仅增10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Generative Data Refinement: Just Ask for Better Data
本文提出了一个名为“生成式数据精炼”(Generative Data Refinement, GDR)的框架,利用预训练的生成模型将包含不良内容(如个人信息、有毒内容)的原始数据集重写为更适合模型训练的、经过精炼的高质量数据集,同时保留了数据的多样性和实用性。
-
Generative AI
Generative AI。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
General Agentic Memory Via Deep Research
AI记忆革命GAM:用“即时研究”取代静态压缩,长文本任务准确率超90%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Gemma 2: Improving Open Language Models at a Practical Size
本文介绍Gemma 2系列开放语言模型(2B、9B、27B),通过在Transformer架构中交错使用局部-全局注意力、采用分组查询注意力,并对2B和9B模型应用知识蒸馏进行训练,实现了在同等参数规模下的最佳性能,甚至能与2-3倍大的模型相媲美。
-
GEM: A Gym for Agentic LLMs
本文介绍了一个名为GEM(General Experience Maker)的开源环境模拟器,它旨在像传统强化学习领域的OpenAI-Gym一样,为智能体大语言模型(Agentic LLMs)提供一个标准化的训练与评估框架,从而推动研究从静态数据集学习转向基于环境交互的经验学习。