世界不会用尽数据:AI真正稀缺的是准确、一致、多样、有用

林知秋AI 前沿📡 觉醒AI2026-09-201430 阅读💛 109 收藏

让我们来消解一个关于人工智能的重大迷思。

世界并没有在用尽数据。它撞上的是一个更重要的约束:获取能提升模型在真实任务上表现的、高质量研究级数据的通道。

大语言模型的规模确实在持续增长。前沿 LLM 已经在数万亿 token 上训练——覆盖了公共互联网上所有可访问的数据、大量已出版材料和各种其他来源。

但想想这个:据估计,仅 2024 年一年,世界就创造了 149 ZB 的数据。一个 500 万亿 token 的训练集(远超任何当前 LLM 的训练量)折合约 0.002 ZB。

换句话说,我们才刚刚开始。还有大片的知识和工作流数据未被 LLM 触及:离线或不可触达或两者兼备的企业与组织数据——通话记录、视频影像、客服记录、供应链数据等等;付费墙之内的信息;以及海量的非文本数据,如视频、图像、音频和传感器流,其中一部分已在线,但未被很好地捕捉,或干脆被模型忽略。这个清单还可以加上视频、医学影像、工业传感器,以及近乎无限的其他东西。

如今大多数 LLM 在大致相同的初始信息集上训练。挑战在于生成能在特定领域和工作流上提升模型表现的数据——无论对前沿实验室还是企业内部都是如此。

在 Turing,我们帮助客户提升模型在编码、科学以及其他具有经济价值的真实任务上的表现。我们同时与前沿实验室和大公司合作,弥合模型训练与部署之间的鸿沟——把研究转化为实际的性能提升。简言之,我们通过为客户提供新数据集来提升其模型在一系列任务和领域上的表现。

要服务好客户,我们必须供应他们尚未拥有的数据——能被证明提升其在意任务上表现的数据。仅仅找到额外数据源是不够的。挑战在于生产满足客户需求的高质量数据,无论他们追求的是哪个领域。

我们通过汲取领域专家的智慧来生成新的高质量数据,领域涵盖金融、医疗、技术、科学等。

这个想法引出一个关键问题:如何判定数据是「高质量」的?答案归结为四件基本的事。(这四个维度不仅关乎数据创建,也关乎评估和后训练——真正的考验是数据能否提升模型表现。)

数据质量的四个维度

**从准确性开始。**第一个问题是:数据集是否匹配你试图记录的流程的真实情况,并且有办法证明它?换句话说:给定同样的目标,另一位专家能否产出同样的数据、得到同样的答案?准确性与可复现性不可分割。

如果你要改进 AI 生成的代码,或训练一个读取医学影像的系统,你需要汲取许多专家的集体智慧,而不只是单个写代码的天才或诊断神医。而如果数据没有提升模型表现,这件事已经失败了。

这是第一个维度。

**第二个要素是一致性。**这里的问题是:你能否证明数据没有系统性漂移或偏差?假设有 10 批数据——第 10 批的质量是否和第 1 批一样好?第一批你以非凡的严谨度完成,但你能否随时间维持那个质量水平?不一致的数据不太可能带来预期的 AI 性能提升。

**第三个要求是多样性。**数据广度对我们支持的前沿 AI 实验室研究者至关重要。你需要在一个更广任务的狭窄元素上避免过采样或欠采样。假设你要训练模型处理针对关键企业软件(如 Jira、Google Calendar 或 Salesforce)的自然语言查询,你不能只聚焦单一用例,需要覆盖用户在意的更广的真实工作流。

而当 AI 智能体把请求组合成一条触及多个应用的自然语言查询时,问题变得更复杂。数据多样性对确保用例的广泛覆盖很重要。

**第四个维度是个统称,我简单地称之为有用性。**我们的客户是前沿 AI 实验室和大企业的研究者。他们在意的是:给定这些数据,模型在他们关心的那类数据上表现是否会提升。我们必须站到这些研究者的鞋子里,像他们一样思考。即使客户出于竞争或保密原因不分享具体目标、需要我们推断预期用例时也是如此。我们如何确保这是针对推断用例的正确数据?这就是推断挑战:预判意图,确保数据尽可能有用、可用、可部署。

底线是:世界不会用尽数据。它受限于获取准确、一致、多样、有用的正确数据。这就是 Turing 所弥合的鸿沟。

本文由 Turing 数据与 AI 负责人 Mahesh Joshi 撰写。


原文信息

作者:turingcom(@turingcom)

  • 发布日期:2026-04-02 原文地址:

文章评论(0

暂无评论,快来抢沙发~