推理 第6页

Evaluating Parameter Efficient Methods for RLVR

LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Prompt Repetition Improves Non-Reasoning LLMs

谷歌新发现:简单重复Prompt,大模型准确率暴涨且零额外延迟。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

The Illusion of Insight in Reasoning Models

普林斯顿揭秘:模型“顿悟”竟是幻觉?百万推理轨迹拆解“自我修正”真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Wait, Wait, Wait... Why Do Reasoning Models Loop?

DeepSeek-R1变“复读机”?MIT揭秘:蒸馏导致死循环暴增,调高温度治标不治本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。