GitSkills:首个开源Agent技能全景数据集,380万份SKILL.md揭示大模型生态野蛮生长
GitSkills:就在这套极简规范提出短短 9 个月后,来自英国伦敦大学学院(UCL)、德国霍恩海姆大学与意大利卡利亚里大学的联合研究团队展开了一次全面地毯式普查。结果令人震惊:仅仅在 GitHub 的公开仓库中,就已经散落着数以百万计的 。
GitSkills:就在这套极简规范提出短短 9 个月后,来自英国伦敦大学学院(UCL)、德国霍恩海姆大学与意大利卡利亚里大学的联合研究团队展开了一次全面地毯式普查。结果令人震惊:仅仅在 GitHub 的公开仓库中,就已经散落着数以百万计的 。
这项工作并非简单地堆叠视频时长,而是以构建交互式世界模型为导向,发布了包含 128,892 个视频片段、总计达 2,826 小时的大规模真实世界探索数据集。整个数据集覆盖全球 113 个国家和地区,且全部配备了相机运动轨迹与分层时序对齐标注。
针对这一未被充分探索的真实现实痛点,上海人工智能实验室与同济大学等机构的研究团队提出了全新的任务范式—— 深度科学数据探索 (Deep Scientific Data Exploring),并推出了端到端轨迹合成框架 SciDataSailor 。
针对这一瓶颈,中国科学院与中国科学院大学的研究团队提出了 SciDSK(Scientific Data Skill,科学数据技能) 框架。这项工作的核心构想十分巧妙:不再试图去重构现有的底层数据仓储,也不把数据集当作笨拙的外部检索对象,而是将特定数据集的科学背景、文件层级语义、前置校验规则与端...
HybridDeepResearch 的提出,给当前过热的“智能体深度研究”浪潮浇下了一盆及时的冷水。它清晰地表明,能够在单一模态下刷出高分的大模型,一旦被置于需要多系统无缝衔接的真实生产力场景下,其表现依旧脆弱不堪。解决这一难题,仅靠增加模型参数量或在上下文窗口中堆叠更多的步骤或许并不够用。
华为与独立研究者共同提出的 SAP(State-Guided Data Synthesis with Argument Provenance) 框架,正是为了补齐这块拼图。
Data:实验结果令人咋舌:原生未经微调的 Qwen3-0.6B 基座在开启思考链时的得分为 67.4%,但经过 Raw-OS 训练后,性能不仅没有提升,反而断崖式下跌至 55.1%,出现了严重的“负向迁移”。
不列颠哥伦比亚大学(UBC)的研究团队提出了 MDA (Model Discovery Agent,模型发现智能体)。这项研究打破了以往“纯大模型试错”与“传统静态贝叶斯推断”各自为战的局限,首次将大语言模型的开集假设生成能力与贝叶斯实验设计严密耦合。
为了解决这一痛点,腾讯联合武汉大学提出了面向生产级数仓任务交付的端到端自动化智能体系统 —— SiriusDeliver 。该系统不仅能写代码,更接管了从业务需求解析、环境元数据对齐、工件全生命周期质检到平台自主提交与自愈诊断的完整链路。
RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟是缺失了特定库的上下文理解、欠缺特定工具参数的转义格式,还是在多步骤长链规划...
大语言模型(LLM)驱动的智能体正在经历一次关键的范式转换:从单轮对话助手,走向能够在真实环境中通过推理、工具调用和工作区操作来执行长周期任务的自治系统。然而,随着任务流程的拉长,现有智能体暴露出了致命的脆弱性。
真实世界的数据科学远不止是在隔离的沙盒中编写几行Python代码并顺利通过单元测试。对于一线的分析师和算法工程师而言,日常工作是一个长周期、跨工具的复杂链路:从异构数据源的获取与清洗,到终端环境的依赖管理,再到JupyterNotebook的探索性分析、IDE中的模型训练以及最终的可视化呈现。
当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...
Meta/牛津重磅:噪声数据引爆LLM训练崩溃!深度比宽度更致命,诊断新法公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
1万条顶100万条!北大DataFlow:像写PyTorch一样搞定大模型数据。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
谷歌揭秘合成数据陷阱:ERM不再万能,新算法破解“模型崩溃”危机。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
挑战Ring-Attention霸主地位:Mesh-Attention实现3.4倍加速,通信暴降85%。
LIME:给LLM喂点“语法糖”,训练效率飙升56%,推理能力提升38%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据智能体“高考”来了!字节跳动DAComp揭示:顶级模型成功率不足20%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据生成提速15倍!Meta开源Matrix框架,用P2P架构颠覆多智能体协作。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI标注成本直降90%!字节ACT框架:让大模型学会「批判性思维」。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
扩散语言模型(DLM)研究发现,在训练数据有限、计算资源充足的实验条件下,扩散模型可能比同规模自回归模型获得更好的数据利用效率。本文解读这种“智能交叉”现象的实验设计、计算开销和适用条件,避免将特定设置下的结果推广为全面优势。
本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。
本文建立了一个理论框架,通过推导精确的缩放定律,揭示了在何时以及为何精心筛选(curate)一小部分数据进行训练,会比使用全部数据获得更好的性能,从而解决了“少即是多”与“多即是多”的矛盾。