Large language models and the entropy of English
挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
10步推理生成电影级视频:快手Kling-Omni全能架构揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微软Kascade:无需训练,H100上长文本推理提速4.1倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
思考预算并非万能:揭秘让大模型更聪明的“性价比”策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
小模型逆袭:MoL让1.2亿参数ModernALBERT超越全参数基线。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SFT正在“毁掉”泛化能力?5大原子技能揭示RL为何是推理的未来。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至91%!Hindsight:让20B模型记忆力超越GPT-4o。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
NeurIPS 2025冠军:Google HiFi-RAG如何用分层过滤让RAG性能暴涨19%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GoAgent:让AI Agent学会“抱团”,准确率93.8%,Token成本降低17%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Transformer 越深越“傻”?几何视角揭秘百层大模型坍塌之谜。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GRPO多奖励训练“失效”?GDPO解耦归一化:AIME准确率提升6.3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给 AI 装上“橡皮擦”:MaRS 架构如何用“遗忘”换取 0.911 的高分表现?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
仅需4-11个纠错案例!FLEx:消除大模型83%顽固错误,无需参数微调。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
速度飙升17倍,成本仅1/19:微软亚马逊用小模型“蒸馏”搞定企业搜索标注。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Sakana AI新作:赋予模型“即时记忆”,4K训练竟能泛化至128K长文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
随机奖励竟能提升数学推理?阿里新作揭秘RLVR背后的“熵减”魔法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微调是“唤醒”还是“注入”?Anthropic提出EDL:量化模型泛化能力的标尺。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解Agent“不可能三角”:EvoRoute实现成本降80%、速度提升3倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent的“金鱼记忆”:EvoClaw揭示其长期编码性能从80%暴跌至38%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型只是“概率填空”:揭秘AI与人类认知的7道“认识论断层”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DeepMind力证LLM能自我纠错:无需外部验证,规划准确率飙升至89%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。