我们总是发高管的趋势性言论,但偶尔要发一些更接地气的东西。
正好,最近Anthropic放出了几个月前在旧金山举办的Code w/ Claude活动讲座视频,有十几场,含金量都很高。今天大家看到的是Databricks AI/ML产品高级总监Craig Wiley的分享。他谈的是关于企业如何将AI技术真正落地到业务关键路径的经验。

之所以选这个内容,是因为企业AI落地的一个工作,除了选模型,其实一个前置工作是修炼数据。作为曾在Google领导Vertex AI创建、在AWS创立SageMaker的资深产品负责人,Craig认为原型与生产之间的鸿沟比大多数人想象的要大得多。
很搞笑的是,他讲了一个Databricks自己的AI案例:他们填写Gartner的问卷调查的时候,最终写了一份450页的文档。Gartner给了180个问题,最终Databricks回传给他们一份450页的文档。所以,我怀疑Gartner也只能用AI看了吧。
不过在深入Craig的演讲之前,有必要了解几个关键平台:
Databricks是一个全球性的数据、分析和人工智能公司,由Apache Spark的原创建者于2013年创立。该公司提供基于云的平台,帮助企业构建、扩展和管理数据和AI,包括生成式AI和其他机器学习模型。 截至2024年12月,Databricks的估值达到620亿美元,服务超过10,000家客户,包括财富500强中的50%以上。
Google Vertex AI是一个机器学习平台,让用户能够训练和部署ML模型与AI应用,并为AI驱动的应用定制大型语言模型(LLM)。Vertex AI将数据工程、数据科学和ML工程工作流程结合在一起,使团队能够使用共同的工具集进行协作。
AWS SageMaker是一个完全托管的机器学习服务。通过SageMaker,数据科学家和开发人员可以快速、自信地将ML模型构建、训练和部署到生产就绪的托管环境中。 该平台于2017年11月推出,使开发人员能够在训练和部署机器学习模型时在不同的抽象层次上操作。
1、【"我妻子说我一直在失败"】
Craig的开场颇为自嘲:"感谢大家坚持到现在。我是Craig,在Databricks负责产品管理,已经三年了。在这之前,我在Google领导了Vertex AI的创建,再之前是AWS SageMaker的创始总经理。"
"正如我妻子所说,"他补充道,"我一直在努力失败,试图在帮助企业构建AI这件事上做得越来越好。"
这种自嘲背后是一个严肃的现实:将AI技术从实验室带到企业生产环境,远比想象中困难。
2、【数据的"噩梦场景":几十次收购,每朵云都有】
在介绍Databricks时,Craig描述了一个让人头疼的场景:"我们是领先的多云或跨云数据平台,有数万客户,数十亿美元收入,同时也是Spark、MLflow、Delta等开源项目的创建者。"

MLflow是一个开源平台,用于管理端到端的机器学习生命周期。它提供了实验跟踪、模型打包、模型注册和部署等核心功能,确保ML生命周期的每个阶段都是可管理、可追踪和可重现的。
但真正的挑战在于企业的数据现状:"Brad刚才谈到了模型的重要性,以及你为模型带来的数据。我们合作的企业面临着一种噩梦般的数据场景。"
"你去跟那些大型跨国银行聊聊,他们多年来进行了几十次甚至上百次收购,数据分布在每朵云上,用着每个可能的供应商,每个可能的服务。他们正试图在这个变革性的技术时刻抓住机会,但后端简直是一团糟。"
更糟糕的是:"问题比这还严重。他们不是只有一个数据仓库,而是有很多个。通常某个系统的专家只懂那一两个系统,不懂其他的。所以如果你的数据仓库专家或流处理专家不是GenAI专家,你可能会发现自己被锁在外面,无法像期望的那样轻松地将数据引入这些系统。"
Craig强调,Databricks最终帮助企业管理数据,并在此基础上提供一整套能力,特别是通过Mosaic AI的AI能力。他们认为这是"通用智能"与"数据智能"的区别:"两者都极其有用和重要。但正如Brad所说,特别是对于企业或大型组织,当他们想要使用这项技术来自动化更多系统或在组织内推动更大洞察时,几乎总是回到连接问题。"

"我们在这里看到Brad将其连接到网络或MCP服务器,但不可避免地,它会回到试图将其连接到他们的数据资产。"
3、【Faxet的故事:"我们有个创意的查询语言名字"】
Craig分享了一个生动的案例——金融数据公司Faxet的转型之路。
"Faxet是一家向银行和对冲基金销售公司财务数据的金融服务公司。Faxet有自己的查询语言,"Craig说,"现在这对我来说是个黄色警告信号——如果你的雇主有自己的查询语言,你得考虑这是不是合适的工作场所。当然,我确实在Google工作过,他们大概有十几种自己的查询语言。"

问题的核心是:任何想要访问Faxet数据的客户都必须学习FQL(Faxet Query Language)。"很有创意的名字,"Craig调侃道。
当GenAI浪潮来临时,Faxet的团队激动不已:"他们想,如果能把英语翻译成Faxet查询语言会怎样?"
4、【"比抛硬币好一点点":59%准确率,15秒延迟】
Faxet的第一次尝试并不成功。
"他们去了自己选择的云服务商,按了一键RAG按钮——我觉得他们做的比一键RAG多一点,但基本上他们带着大量的示例和文档的巨大提示词,以及包含大量提示词、示例和文档的巨大向量数据库出现了。"
RAG(Retrieval-Augmented Generation,检索增强生成)是一个优化大型语言模型输出的过程,让模型在生成响应之前参考其训练数据源之外的权威知识库。RAG扩展了LLM已经强大的能力到特定领域或组织的内部知识库,而无需重新训练模型。
结果呢?"59%的准确率,大约15秒的延迟。"
Craig特别强调了延迟的意义:"我分享这个延迟指标不仅因为它是重要的客户体验指标。在GenAI的世界里,它可能是我们最接近成本指标的东西。你基本上是在为计算时间付费。所以那15秒基本上就是15秒的成本。"
"他们联系我们说,'好消息是我们有了GenAI解决方案。坏消息是,它只比抛硬币好一点点。'"
5、【拆解巨型提示词:从单体到多步骤】
Databricks团队的解决方案是将问题分解:"我们真正做的是将提示词分解成各个独立的任务。基本上,我们把那个提示词变成了一个多节点、多步骤的链或流程,以更全面地解决这个问题。"
"我们这样做的真正原因是,它让我们有机会开始在问题的每个步骤上调优性能。"
结果是显著的:"我们让他们达到了85%的准确率,6秒的延迟。"
"在85%的准确率下,他们做了两件事。他们转向我们说:'很好,我们可以放心地向现有客户展示了。'然后他们说:'我们明白你们是如何帮助我们的了。我们不想再付钱让你们帮忙了。我们自己来。'"

"我最后一次跟他们聊时,他们已经把准确率提升到了90多,最后一次聊时,迁移到Claude是他们接下来的路线图项目之一。"
6、【伯克利的发现:"没有系统是简单的"】
Craig引用了伯克利人工智能研究实验室的一项研究:"在GenAI真正起飞后,伯克利的研究人员调查了所有流行的生产AI系统。他们发现,这些系统没有一个像单输入单输出的基本系统那样简单。这些系统都是非常复杂的多节点、多部分系统,被链接在一起创造出真正出色的结果。"
这个发现强化了Databricks的方法论:不是追求一个万能的模型,而是构建可控、可调的复杂系统。
"我们在Databricks的目标真的是简化为客户创建这些能力,但非常具体地说,我们想在有财务和声誉风险的领域做这件事。"
Craig明确区分了不同的使用场景:"如果你想做的是为你和你的朋友们构建一个聊天机器人,搜索你的文档、邮件或最近的PRD(产品需求文档),很好,去做吧。一键RAG或提示词就行。"
"但如果你想构建的是你信任的东西,能够放入财务或声誉风险情况的东西,那就需要一些额外的能力。"
7、【"用最不确定的部分构建确定性系统"】
Craig指出了一个根本性的矛盾:"我们看到的许多开发这些系统的人,他们试图使用整个软件栈中最具概率性的部分来开发确定性系统。"
"所以其中一个关键是,我们如何帮助他们持续驱动那些可重复确定性的水平?"
Databricks的解决方案围绕两个核心:
治理(Governance):"在最紧密的层级、最细的粒度上,确保你能控制这个东西能访问什么、能做什么。"
"在Databricks上,我们不只是管理你的数据。我们还管理对模型的访问,管理工具,管理查询。我们管理对数据的访问,管理对模型的访问,管理所有部分。有一个部分我们还没有管理,就是MCP服务器。但请关注我们。几周后我们有个会议,你可能会来看看,希望我们会有消息给你。"
评估(Evaluation):"我今天早上很兴奋。我见了一家公司,一个全球物流供应商,这是我第一次遇到客户说:'嘿,我们构建了这个系统,准确率大约是85%。'这太令人高兴了,因为通常人们会说:'嘿,我们构建了这个系统。我们已经在生产中了。我们为此感到非常自豪。'然后我问:'它有多准确?'他们会说:'哦,挺好的。'"

"所以能够真正开始量化并爬坡优化,我们认为是至关重要的。"
8、【工具调用的突破:"Claude改变了一切"】
Craig特别强调了工具调用(tool calling)的重要性:
"工具调用在试图构建确定性系统时非常关键。通常我们看到的是有人使用LLM作为分类器,从六个或八个路径中选择一个——六个或八个工具。这些工具可能是代理,可能是SQL查询,可能是任何类型的可参数化函数。"
"然后我们看到下一层,另一组代理在一组工具之间进行选择,最终你得到了这个巨大的决策树,从确定性的角度来看这很好,真正减少了这些系统中的熵。"
但在与Anthropic合作之前,这个方法面临挑战:"在我们与Anthropic建立关系之前,我们跟人们谈论这些东西,但工具调用还没有达到需要的水平。你会遇到这样的情况:明明应该调用什么工具是显而易见的,但模型却始终无法正确判断。"
"有了Claude,这完全改变了。我们现在看到这些系统进行工具调用的能力真正成为软件开发工程师和应用工程师使用高度概率性后端构建准确定性系统的方式。"
"Claude在许多方面为我们完成了这个拼图,提供了直接在Databricks内可用的前沿LLM,具备我们客户汇集所需的所有能力来真正增强他们正在组合的用例。"
9、【为什么选择Claude和Databricks】
Craig总结了Claude和Databricks结合的优势:
"首先,Claude在Databricks上原生可用,在任何云上——在Azure、AWS、GCP上,你都可以在你的Databricks实例中调用Claude。"
"你可以在Databricks上构建由Claude驱动的最先进的代理,然后从根本上你可以连接Claude。"
"使用Databricks的绝大多数人都是较低层级的数据工程师,他们构建大规模架构和大规模治理策略系统。你可以使用Claude作为该系统中的一个主体。正如你所看到的,包括即将推出的MCP服务器。"
Craig强调:"为什么要和我们一起使用?真的归结为将最强的模型与最强的平台配对,在完全受控的环境中使用。"
10、【银行们的秘密:"一半以上在用Claude"】
Craig分享了一个有趣的观察:"我最近参加了一个银行聚会,有10到12家银行在场。我们都在讨论他们正在做什么。我认为房间里超过一半的银行在我们说话时就在用Claude做原型开发。"
"其中一家银行确实举手说:'我们不被允许在这个行业使用任何生成式的东西。'房间里其他正在做这些事情的银行都笑了。"
"真正的区别在于,那个人说的是'嘿,我们没有在组织内使用这个的控制措施',而那些银行、医院和其他高度监管、高度规范的领域已经完成了这个过程,现在可以完全访问这项技术,不再需要等待技术来找他们。"
"你可以在商业上看到一些优势,规模和运营能力真的增加了一起使用它的理由。"
11、【高价值用例的涌现】
"我们一起使这些真正高价值的用例成为可能,坐在GenAI和企业交叉点的一个好处是能够看到这些高价值用例的出现。"
"这真的给了我们信心,看到这项技术不会是另一个三年的昙花一现,而是真的会最终改变我们所有人的工作方式,我们现在可以看到这在我们合作的一些组织中正在实现。"
Craig再次强调了治理和评估的重要性:"我在开始时说过,这归结为治理和评估。对我们来说,一个没有另一个是不完整的。"
"你可以锁定这些东西。你可以控制它们访问什么。你可以控制它们如何在你的数据资产中运行。但如果你不衡量系统的质量,那么你真的不会知道你构建的这个系统是否足够高质量,能够开始投入到那些更高风险的用例中,而不需要在每一步都有人工批准。"
12、【评估平台:让AI可量化】
"这就是评估的作用。这是我们的评估平台。顺便说一下,你引入一个黄金数据集。我们有一系列LLM评判者来帮助确定你的性能是否达到需要的水平。"
"顺便说一下,整个系统为你的主题专家提供了第二个UI。我们一次又一次地看到,构建这些系统的应用开发人员不一定是这些主题的专家。因此,为该主题专家提供一个简化的UI,让他们能够快速轻松地提供上下文或纠正提示或创建更好的答案是至关重要的。"
"这就是我们如何开始获得信心的路径,相信这些系统可以在稳健的高风险情况下执行。"
Craig引用了一位客户的话:"前几天有个人说,'哦,你只是在对智能体进行单元测试。'我说,'嗯,我喜欢认为它比这更聪明,但是的,差不多就是这样。'真正在预期用这个系统处理的问题空间中搜索,然后深入到最细粒度的层次,以确保这个系统正在执行。"
"这个评估系统,我应该说,其中很多是在MLflow中开源的。LLM评判者不是,但这里的很多功能都可以运行,无论你是否使用Databricks。你可以使用开源MLflow来做这些评估,或者如果你使用Databricks,你可以连接它并获得我们一些自定义评判者的所有价值。"
13、【450页文档的终结者】
Craig分享了一个让产品经理们解脱的应用案例——自动化回答Gartner和Forrester的问卷:
"有这些分析师,Gartner和Forrester等等,他们会写报告卡,评估所有供应商有多好,哪些供应商是领导者等等。我们在这些评估中表现不错。但我真正兴奋的是,我们现在使用Claude来完成这些。"
"举个例子,上次我们填写Gartner的这些东西时,我们最终写了一份450页的文档。他们给了我们180个问题,我们最终回传给他们一份450页的文档。"
"使用Claude,我们实际上把我们的文档、博客、关于我们系统的大量信息,以及我们过去为这类事情写的答案都输入进去。现在当Gartner或Forrester或其他机构给我们发这些问卷时,我们就通过机器人运行它们。"
"我要说,我们仍然会阅读答案,有时会纠正其中一些,但这种能力让我们从原来需要数百小时的产品经理、工程师和营销人员敲键盘整理材料,变成了现在只是编辑一份我甚至不会称之为粗稿的东西——而是编辑一份非常接近最终稿的Claude输出。"
14、【从开源到Claude的飞跃】
"我之所以展示这个,是因为我们构建这个经历了许多迭代。我们从开源模型开始。然后我们使用了另一个供应商的非Anthropic模型,然后我们开始使用Claude。"
"直到我们开始使用Claude,结果才好到我们第一次有了可以不加修改就发布的结果。当我们开始使用Claude时,我们第一次得到了可以直接发布的结果。这对我们来说是巨大的胜利。"
"这是我特别兴奋的项目之一,因为它让我的生活变得更好。我们刚刚发布了一篇关于这个的博客。真的很令人兴奋的东西。如果你必须花时间填写这些该死的问卷。"
15、【Block的Goose:每周节省8-10小时】
Craig还介绍了另一个成功案例——Block(前Square)的开源系统Goose:
"Block也是我们的客户,Block构建了这个叫做Goose的开源系统。如果你还没有试过Goose,应该看看。正如我说的,它是开源的。"
"它真的是一个开发环境,一个代理式开发环境,用来加速他们的开发者能够构建。你知道,它基本上内置了Claude,连接到他们所有的系统和数据,这样他们可以更快更容易地构建,远远超越我们习惯的代码补全之类的东西,进入一个更有针对性的系统,能够改进他们的工作流程和类似的东西。"
"你可以看到每周用户采用率增长40-50%,每周节省8-10小时。看到Block在Databricks上使用Claude如此成功,以及看到Goose开始在市场上流行,越来越多的人玩耍并开始尝试Goose,这真的很令人兴奋。"
16、【"不是学习你们的东西,是告诉CDO我的工作有多难"】
在演讲结束时,Craig分享了一个有趣的小插曲:
"我今天早些时候参加的会议,当我走出会议室时,AI负责人跑过来对我说:'嘿,我真的很感谢今天的会议。'我说:'不客气,很高兴分享,很高兴跟你聊我们在做什么。'"
"他说:'不不不不,我感谢的不是了解你们的东西。我感谢的是你告诉我们的首席数据官我的工作有多难。'"
Craig最后总结道:"所以,让我们知道我们如何能在这个旅程中帮助你。"
这次演讲展示了企业AI落地的真实挑战:不是模型不够强大,而是如何在混乱的数据环境中、在需要确定性的业务场景中、在严格的监管要求下,让AI真正创造价值。正如Craig所说,价值来自于"AI系统和数据系统之间的连接"——通过像Databricks这样的数据智能平台,结合Claude这样的前沿语言模型,企业才能真正将AI的潜力转化为业务价值。