数据工程

中科院提出SciDSK:科学数据打包成Agent技能,24项评估命中23项

针对这一瓶颈,中国科学院与中国科学院大学的研究团队提出了 SciDSK(Scientific Data Skill,科学数据技能) 框架。这项工作的核心构想十分巧妙:不再试图去重构现有的底层数据仓储,也不把数据集当作笨拙的外部检索对象,而是将特定数据集的科学背景、文件层级语义、前置校验规则与端...

HybridDeepResearch:跨越SQL与搜索,顶尖模型Pass@8仅54%

HybridDeepResearch 的提出,给当前过热的“智能体深度研究”浪潮浇下了一盆及时的冷水。它清晰地表明,能够在单一模态下刷出高分的大模型,一旦被置于需要多系统无缝衔接的真实生产力场景下,其表现依旧脆弱不堪。解决这一难题,仅靠增加模型参数量或在上下文窗口中堆叠更多的步骤或许并不够用。

RSIBench-Data:大模型自主搞数据科研,58%能突破但78%越改越差

RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟是缺失了特定库的上下文理解、欠缺特定工具参数的转义格式,还是在多步骤长链规划...

清华ACID-Agent:为Agent引入数据库四大特性,提升10.6%

大语言模型(LLM)驱动的智能体正在经历一次关键的范式转换:从单轮对话助手,走向能够在真实环境中通过推理、工具调用和工作区操作来执行长周期任务的自治系统。然而,随着任务流程的拉长,现有智能体暴露出了致命的脆弱性。

DSAgentBench:真实环境测试275个数据科学任务,最强Agent仅56.7%成功率

真实世界的数据科学远不止是在隔离的沙盒中编写几行Python代码并顺利通过单元测试。对于一线的分析师和算法工程师而言,日常工作是一个长周期、跨工具的复杂链路:从异构数据源的获取与清洗,到终端环境的依赖管理,再到JupyterNotebook的探索性分析、IDE中的模型训练以及最终的可视化呈现。

MEMENTO:大模型学会自主管理上下文,KV缓存直降2.5倍!

当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...

Learning from Synthetic Data: Limitations of ERM

谷歌揭秘合成数据陷阱:ERM不再万能,新算法破解“模型崩溃”危机。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Diffusion Language Models are Super Data Learners

扩散语言模型(DLM)研究发现,在训练数据有限、计算资源充足的实验条件下,扩散模型可能比同规模自回归模型获得更好的数据利用效率。本文解读这种“智能交叉”现象的实验设计、计算开销和适用条件,避免将特定设置下的结果推广为全面优势。

Reusing Pre-Training Data at Test Time is a Compute Multiplier

本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。

Why Less is More (Sometimes): A Theory of Data Curation

本文建立了一个理论框架,通过推导精确的缩放定律,揭示了在何时以及为何精心筛选(curate)一小部分数据进行训练,会比使用全部数据获得更好的性能,从而解决了“少即是多”与“多即是多”的矛盾。