许多贴着"AI智能体"标签的产品,不过是经过包装的聊天机器人或重新上架的助手工具,这种现象被称为"智能体清洗"。高德纳(Gartner)在今年5月发布的一份报告中警告IT领导者,切勿"将供应商的市场定位误认为是真正的自主能力"。然而,在现实中区分真假往往知易行难。

构建真正的智能体能力成本高昂。国际软件开发与技术咨询公司Acropolium的创始人兼CEO奥列克西·格里布(Oleksii Glib)表示:"全球真正具备这种能力的玩家,也许不超过10家。"

"市面上几乎其余的产品都是对这些头部玩家模型、工具和接口的二次封装。这也正是大量产品被重新贴上'智能体'标签的原因——真正的东西造价不菲,仿冒更省钱。"格里布说道。

随着越来越多的产品声称具备智能体能力,CIO们该如何辨别真伪?

智能体与其他自动化技术的区别

辨别真伪的一个切入点,是超越标签和演示,深入了解产品的实际能力。

"我在评估一个智能体平台时,不会首先问它是否具备自主性。每家供应商都能让演示看起来像是自主运行的。"IBM解决方案架构师卡尔提克·卡鲁纳尼提(Karthik Karunanithi)说。

评估智能体平台的第一步,是弄清楚该产品实际提供的是哪种类型的自动化。卡鲁纳尼提指出,供应商经常模糊聊天机器人、AI助手、机器人流程自动化(RPA)与智能体之间的界限,尽管这几类技术各自服务于不同目的,也提供不同级别的自主能力。

对于什么是智能体、什么不是智能体,市场上存在大量混淆,这并不难理解。

企业级生物特征身份认证公司TokenCore的CEO凯文·苏拉斯(Kevin Surace)表示:"如今许多被称为智能体的产品,不过是界面更好看的聊天机器人、附加了语言模型的RPA工作流,或者只能起草答案、无法独立将任务推进到结果的AI助手。"

各类自动化技术的特征

这几类技术各有其适用场景和鲜明特征。

以RPA为例,它遵循预设脚本运行:点击这里、复制该字段、提交该表单。一旦流程发生变化,它就会出错,苏拉斯解释道。给RPA机器人加上对话能力,并不会改变其底层逻辑。

相比之下,AI智能体具有明确目标,能自主选择工具和数据来源,并独立规划和执行一系列操作。

"真正的智能体能够针对变化进行推理。它能处理数据缺失、信息冲突、系统状态变化或异常情况,并根据业务目标——而非固定的规则序列——判断下一步该做什么。"苏拉斯说道。

技术咨询与创投加速公司Tribeca Softech的首席AI战略官阿曼·马哈帕特拉(Aman Mahapatra)则指出,聊天机器人只有一个职能:对用户的单次输入作出回应。"由用户决定下一步提问什么,对话轮次之间基本不保存任何状态,一旦偏离脚本,系统就会给出兜底回复或将对话转交给人工。"马哈帕特拉说。

归根结底,区别在于系统能够执行多少独立决策。简而言之:

对于评估供应商方案的CIO来说,这些差异比产品是否被贴上"智能体"标签更为重要。

值得注意的是:无论智能体多么强大、多么炫目,这并不意味着你一定需要它。即使某款产品具备真正的智能体能力,CIO也应该评估其自主性是否值得为此承担额外的成本与管理复杂度。

格里布表示,在大多数情况下,他建议直接忽略智能体产品。核心原因在于:"它们不过是消耗大语言模型的Token、构建一个更好的界面,然后以更高的价格出售。对买家而言,这没有实际价值,因为你完全可以在大语言模型上自己实现。"他说,如果某家供应商执意要说服他,就必须"清晰阐明他们所带来的额外价值"。

识别真伪的关键信号

如果只能进行一项测试来区分各类产品,就测试这个:系统能否针对从未见过的目标,通过自主组合工具来完成任务?还是在脱离训练脚本后便束手无策?

"如果在面对新目标时,工具组合能力依然有效,那它就是真正的智能体。如果不行,那不管供应商怎么称呼它,它都属于其他三类。"马哈帕特拉说。

但单项测试的表现只是评估的一部分。CIO还应审查产品的构建方式,以及它能否在实际生产环境中持续稳定地交付成果。

企业资源规划软件提供商Certinia的首席业务官普拉萨德·纳拉西曼·苏鲁(Prasad Narasimhan Sulur)建议:"仔细审视供应商如何对解决方案进行加固和强化。"

"一个仅用简单界面包裹大语言模型的产品,和一个拥有清晰数据输入架构、业务规则以及工作流确定性输出的产品,两者之间存在本质差异。前者在演示中可能表现亮眼,但在生产环境中会迅速劣化;后者则能随着模型和运行条件的变化保持可靠性。"苏鲁说。

透明度是真正AI智能体的另一显著特征。

专业保险软件供应商#Total Systems的董事总经理瑞斯·柯林斯(Rhys Collins)表示,以保险行业为例,"我们历来对各种技术术语保持审慎,总是在真正理解其内涵之后才做决策。"

柯林斯认为,供应商将某款产品称为AI智能体、AI助手还是自动化平台,并非最关键的问题。真正重要的是弄清楚:这项技术究竟能自主做出哪些决策,以及这些决策能否被审计追溯。"在受监管行业,透明度的重要性往往超过技术本身。"

这种透明度对于任何行业的CIO正确判断一款自动化产品是否具备智能体能力至关重要。你可以要求供应商提供智能体的推理与决策追踪记录。供应商应能展示智能体调用了哪些工具、工具返回了什么结果、如何使用这些工具、为何在每一步选择特定操作,以及如何验证某项操作确实已经执行。

"如果供应商无法展示决策追踪记录,也无法解释结果是如何被验证的,那你大概率看到的只是一个披着智能体标签的工作流。这就好比给一辆普通轿车加上一个尾翼,然后声称它是赛车。"卡鲁纳尼提说。

归根结底,CIO应当寻求恰当程度的自主能力,并确保其背后有组织所需的监督机制与问责体系作为支撑。

"目标不是购买自主程度最高的系统,而是在可问责的管控框架下部署真正有用的自主能力。"苏拉斯说。

Q&A

Q1:如何快速判断一个AI产品是真正的智能体还是普通自动化工具?

A:最有效的单项测试是:让系统处理一个它从未见过的新目标,观察它能否自主组合工具来完成任务。如果能,大概率是真正的智能体;如果在脱离训练脚本后就无法运作,那不管供应商如何宣传,它都只是聊天机器人、RPA或AI助手中的一种。此外,还要要求供应商提供决策追踪记录,包括调用了哪些工具、为何选择每一步操作,以及如何验证操作结果。

Q2:RPA、聊天机器人和AI智能体有什么核心区别?

A:RPA遵循预设脚本运行,流程一变就会报错,加上对话能力也不改变其本质;聊天机器人只负责响应用户的单次输入,轮次之间不保存状态,偏离脚本就会转入兜底回复或交给人工;AI智能体则有明确目标,能自主选择工具和数据来源,遇到数据缺失、信息冲突或异常情况时,能根据业务目标独立判断下一步行动,而非依赖固定规则序列。

Q3:CIO在购买AI智能体产品时应该重点关注哪些方面?

A:重点关注三个维度:一是产品架构,区分仅封装大语言模型的薄层界面与具备完整数据输入、业务规则和确定性输出的产品;二是透明度,要求供应商展示智能体的推理过程和决策追踪;三是实际价值,评估其自主能力是否值得为此支付更高价格和承担更高复杂度,在很多场景下,直接调用大语言模型自行构建反而更划算。

InformationWeek