基础模型 第5页

Emergent Introspective Awareness in Large Language Models

Anthropic重磅:给大模型“植入思想”,Claude Opus 4.1展现惊人内省能力。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Geometric and Dynamic Scaling in Deep Transformers

Transformer 越深越“傻”?几何视角揭秘百层大模型坍塌之谜。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Increasing the Thinking Budget is Not All You Need

思考预算并非万能:揭秘让大模型更聪明的“性价比”策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Kling-Omni Technical Report

10步推理生成电影级视频:快手Kling-Omni全能架构揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Large language models and the entropy of English

挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Large language models are not about language

剑桥等名校联合檄文:LLM根本不懂语言!70MW能耗下的概率游戏。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Learning to Discover at Test Time

TTT-Discover:开源模型+测试时训练,仅需数百美元刷新多领域SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Mechanisms of Introspective Awareness

AI也能“反思”了?Anthropic揭秘LLM内省电路,检测率飙升75%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

mHC: Manifold-Constrained Hyper-Connections

DeepSeek魔改残差连接:mHC仅增6.7%开销,完美驯服大模型训练不稳定性。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

MiMo-V2-Flash Technical Report

仅15B激活参数硬刚DeepSeek!MiMo-V2-Flash揭秘:混合注意力与多教师蒸馏的极致效率。

Monadic Context Engineering

告别“面条代码”:普林斯顿用Monad重塑AI Agent架构,健壮性狂飙。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Monitoring Monitorability

OpenAI意外曝光GPT-5 Thinking:思维链越长越安全?深度解析CoT监控新基准。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Nested Learning: The Illusion of Deep Learning Architectures

打破深度学习“幻觉”:哥大&谷歌提出Nested Learning,重构大模型记忆与进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

NRGPT: An Energy-based Alternative for GPT

NRGPT重构GPT底层逻辑:推理即能量下降,抗过拟合能力显著提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

NVIDIA Nemotron 3: Efficient and Open Intelligence

英伟达Nemotron 3发布:Mamba+MoE混合架构,百万上下文与NVFP4训练揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。