专家判断、疑难案例和机构反馈正逐渐成为专业化人工智能(AI)工具的重要输入来源。

一个快速增长的市场正将AI开发者与医生、律师、科学家及其他专业人士连接起来,这些专业人士能够创建和评估专业任务。随着新型AI工具的普及,企业可能会发现,自身的工作流程、边缘案例和专家决策记录能带来更多竞争优势。

2026年,Thinking Machines Lab与桥水基金(Bridgewater Associates)希望测试人工智能是否能帮助投资者筛选每天需要审阅的大量新闻和研究资料。

这项研究测试了六项信息筛选任务,包括判断一篇文章是否具有相关性。桥水最初使用非专业人士标注的样本来判定内容是否相关或有用,但许多判断结果被证明是错误的。存在争议的样本被提交给桥水的投资者进行复核,这些反馈随后被用于微调一个专业化模型。

最终得到的模型表现优于桥水此前测试过的其他模型,同时运行成本也大幅降低。

这项实验规模虽小,但揭示的道理很简单:金融信息本身容易获取并输入AI工具,但判断哪些信息真正重要的可靠判断力却更难获得。

判断力:AI数据中的稀缺资源

大语言模型是基础模型的一种,基础模型是可适应多种不同任务的通用型AI系统。目前能力最强的模型通常被称为前沿模型。

大语言模型能够大规模处理财务报告、法律文件和科学论文。但获取这些资料并不能复现一个在该领域深耕多年的从业者所具备的判断力。

专家们清楚哪些细节值得关注、哪些错误至关重要,以及常规流程何时可能失效。这些经验有些可以被记录下来,但另一些只能通过人们所做的决策才能显现出来。例如,一份投资分析可能信息准确,却聚焦在错误的信号上。如果没有可靠的方式来评判样本质量,单纯生产更多样本的效果也是有限的。

即便如此,专家判断也并非唯一客观的真理。专业人士之间可能存在分歧,因为他们的目标、风险承受能力或机构优先事项各不相同。基于桥水决策训练出的模型,学到的是桥水认为的相关性,而非某种放之四海而皆准的投资判断标准。

正是这种机构特有的判断力,竞争对手在开发新的AI工具(如基础模型)时可能难以复制,这使得这类数据在AI时代成为组织竞争优势的关键所在。

专家成为AI数据供应链的一环

对专业化人力输入的需求已经在支撑一个规模可观的商业市场。一批快速增长的企业正将AI开发者与医生、律师、科学家及其他专业人士连接起来,让这些专业人士创建和评估专业任务。

据TechCrunch报道,其中一家名为Micro1的公司,其年化总收入运行率在八个月内从1亿美元增长至5亿美元。报道还指出,同类公司Mercor的年化总收入约为20亿美元,Handshake约为10亿美元。这些数字显示出当前专业化AI数据与评估领域的支出规模。

这些公司的业务已超越传统的数据标注范畴。Mercor介绍了涉及专业基准测试、数据集和评估环境的项目,它要求专业人士撰写贴近实际的问题、审阅模型输出结果,或找出需要专业知识才能发现的错误。

这一市场可能会让通用性质的专业知识更容易获取。但与特定组织绑定的知识——比如关于其客户、以往决策、内部流程和特殊边缘案例的信息——则更难以购买。

互联网未曾捕捉到的企业知识

支撑企业做出良好决策的许多信息,从未在网上公开发布过。组织内部系统中沉淀着多年积累的特殊客户案例、运营失误和各类决策。经验丰富的员工清楚哪些例外情况值得关注,以及何时不应遵循常规流程。

据《金融时报》报道,这正是律所Kirkland & Ellis投入5亿美元开发自有AI平台的原因,该项目有约250名律师和180多名技术专业人员参与,同时该律所仍在继续使用外部AI产品。

随着能力强大的基础模型被更多组织获取,单纯的可获取性可能越来越难以解释企业在AI应用效果上的差异。这种差异反而可能源于更优的检索能力、更丰富的样本、更强的评估体系,或者对以往决策成效的更完善记录。因此,一个能持续产生组织专属反馈的系统,可能更难以被复制。

当员工审核AI输出结果时,他们会修正建议、否决看似合理的答案、上报异常案例,并在之后观察决策是否成功。每一次干预都可能揭示出优秀表现应有的样貌。

许多组织只记录最终决策,但塑造这一决策的修正过程却难以被再次利用。记录下这些修正与决策,可能为未来的评估、检索系统或模型改进提供有价值的素材。

合成数据仍需可靠验证

合成数据是人工生成而非直接从真实世界观察中收集的数据,它可能会降低对某些人工生成样本的需求。

世界经济论坛已经研究过合成数据如何缓解AI发展面临的限制。英国政府委托编写的《2026年国际AI安全报告》指出,数学、编程和形式化推理是合成方法能够发挥特别优势的领域,因为这些领域的答案可以对照相对明确的标准进行核验。

合成数据的验证也不一定需要人工介入。软件工具、模拟系统、观测结果或其他AI系统都可以提供反馈。更完善的自动化评估工具,同样能减少对昂贵的专家审核的依赖。

从经济角度来看,一个关键问题是:一个由AI驱动的系统能以多低的成本获得关于其输出质量的可信反馈。在验证能够可靠自动化的领域,廉价的合成数据可能会变得极为丰富;而在质量依赖于稀缺专业知识或需要长期观察才能显现的结果的领域,获得优质反馈的成本可能依然高昂。

捕捉判断力这一过程同样带来了治理层面的问题。员工的修正记录、客户互动和专业决策可能包含机密或个人信息,组织需要获得适当的授权才能重新利用这些数据,并建立起相应的访问控制机制。

收集可靠的企业绩效数据

随着越来越多的组织能够获取能力更强的基础模型,它们的部分竞争优势可能会转向围绕这些模型的反馈信息,包括哪些输出取得了成功、哪些失败了,以及经验丰富的专业人士否决了哪些看似合理的答案。

其中一些知识可以被购买或模仿,但一个持续更新、记录某一组织如何做出疑难决策并从结果中学习的档案,可能更难以复制。因此,下一轮AI数据争夺的重点,或许不再是收集更多信息,而是获取关于"何为真正优秀表现"的可靠证据。

Q&A

Q1:为什么专家判断对AI训练如此重要?

A:因为专家学到的是哪些细节值得关注、哪些错误至关重要以及常规流程何时可能失效,这些经验很多无法直接文档化,只能通过实际决策体现。桥水基金的案例显示,非专家标注的样本判断错误率较高,而经过投资者复核反馈微调后的模型表现明显更优。

Q2:企业专属的知识数据为什么比购买通用专家知识更有价值?

A:因为与特定组织绑定的知识,比如客户信息、以往决策记录和内部特殊案例,很难通过市场购买获得。这类知识竞争对手难以复制,从而成为企业在AI时代保持竞争优势的关键所在。

Q3:合成数据能否完全替代人类专家反馈?

A:不能完全替代。在数学、编程等答案可对照明确标准核验的领域,合成数据效果较好;但在依赖稀缺专业知识或需长期观察结果的领域,获得可靠反馈的成本依然较高,仍需人类专家参与验证。

World Economic Forum