AI数据摄取管道对信息的渴求几乎无法满足,首先涵盖语言、数字和表格数据,与此同时,其他平台也在同步构建大型音频、图像和视频模型。

横跨上述所有领域的,是那些承载着复杂文档和非结构化数据的文件格式——而这正是现代AI所依赖的源数据中鲜少被探索的领域。

为了打通与各类组织天然积累的无模式、自由形态、未经整理的信息之间的连接,企业视觉智能公司Valantor于周二宣布收购非结构化信息RAG专家EyeLevel。此次收购正式推出了Valantor的企业视觉智能平台,将EyeLevel的文档智能能力与Valantor自身的运营专长相融合。

EyeLevel首席执行官兼联合创始人Benjamin Fletcher向The New Stack表示,若企业未能采用视觉智能技术,在AI时代仅依靠人工处理的方式很快就会出现瓶颈。

"企业约80%的知识存储在数以百万页计的视觉结构复杂的PDF、PPTX和DOCX文件中,"Fletcher说,"这些信息远超任何大语言模型上下文窗口的处理能力,实际上对大语言模型和智能体而言都是不可访问的。"

他解释道,事务性工作流(如发票处理和理赔处理)通常涉及"视觉结构极为复杂且多样"的文档,企业至今仍依赖人工处理,而人工处理速度慢、成本高且容易出错。

"我们发现,团队手工构建的黄金数据集通常存在10%至25%的错误率,"Fletcher说,"讽刺的是,这些团队往往对AI提出比对自己员工更高的标准。如果数据主权对企业至关重要,问题就变得更加棘手:在文档不离开自身基础设施的前提下用AI解决这些问题,是这项工作的困难模式,而能做到这一点的工具寥寥无几。"

Valantor指出,当前大多数AI公司专注于模型本身,而该公司则专注于"那些模型目前看不到的信息"。这些尚未被充分利用的宝贵数据,被锁存在文档、理赔档案、合同、工程图纸、报告、表单、演示文稿及其他视觉结构复杂的内容之中。

Valantor的旗舰平台产品GroundX可在数据所在的位置直接运行,支持私有云、主权基础设施、本地部署以及完全隔离的气隙环境。

"GroundX是非结构化文档的摄取与检索层,"Fletcher解释道,"它是一个经过精密调优的系统,检索层直接消费摄取层的输出内容。所有功能均通过REST API、SDK和MCP对外开放。它以REST API、SDK和MCP的形式交付,Helm Chart可直接接入团队现有的部署流水线,我们的智能体框架还能让Claude、Codex等编程智能体自行构建集成。"

作为此次收购公告的一部分,Valantor还推出了GroundX Studio。GroundX Studio内置的智能体框架能力可与现代AI开发环境集成,使开发者能够构建安全的AI应用,在不脱离现有基础设施的前提下调用企业知识。

GroundX Studio还将能力延伸至业务用户,使组织无需大量定制开发,即可创建由AI驱动的工作流和应用程序。

如果担心这一新的数据摄取流会给云端工作负载、应用执行延迟、数据库检索时间以及整体Token用量带来新的压力,Valantor和EyeLevel表示,其平台的编排层已将这一问题纳入考量。

"我们不会将完整的图纸发送给语言模型,我们的视觉模型会先将每个页面拆分成各个元素,"Fletcher确认道,"处理过程在文档的不同层级进行多轮处理,同一轮次内的所有任务并行执行,因此存在一个最低处理时间,但不会随页数线性增长。每个智能体只负责一项小任务,因此成本较低的模型往往已经足够,希望直接控制成本的团队可以通过Helm在自有硬件上运行整个技术栈。"

尽管AI与手写识别的结合并非新鲜事——ViWoods AiPaper数字电子墨水手写平板搭载了实用的AI功能,reMarkable等厂商也提供类似产品——但这一应用场景目前尚未得到大规模普及。Valantor表示,其底层数据模型和自定义启发式算法在处理手写批注时,能够弥合"数据理解鸿沟"。

"我们专有的视觉模型在超过百万页企业文档上进行了精细调优,能够像人类一样解读页面内容:表格、段落和图表,"Fletcher强调道。

他表示,手写标注会以保留布局上下文的页面元素形式被捕获,随后由专项智能体将每个元素提炼为同时适配搜索和大语言模型补全的上下文对象。

"更小的片段,更低的认知负载——这就是我们缩小差距的方式,以更低的成本实现更高的准确率,从而带来更好的性能表现和显著的成本优势,"他补充道。

这项技术的实际应用案例包括:法荷航集团(Air France-KLM)使用GroundX开发了一款AI客服助手,该助手基于数千份政策文档进行训练,在复杂政策相关问题上实现了96%以上的准确率;AskVet则利用该平台将十余年积累的专有兽医数据投入运营,使高达85%的客户咨询能够实现自主解答,同时显著提升了运营效率。

综合以上内容,我们是否已经到了可以宣称文档管理变得有趣、引人注目甚至充满魅力的时刻?

当然没有。这个领域或许将长期背负某种被轻视的标签。不过随着我们与AI工具的互动日益深入,当这些工具开始分析企业长期积累却始终沉睡的非结构化信息时,这种状况或许会有所改观。就目前而言,文档管理在企业中的地位,大概仍如同餐桌上那盘被人推来推去的蔬菜——抱歉,谁来帮我把这盘球芽甘蓝和蒸芜菁传过来?

Q&A

Q1:GroundX是什么?它能处理哪些类型的文档?

A:GroundX是Valantor旗舰平台的核心产品,专门负责非结构化文档的摄取与检索。它能够处理PDF、PPTX、DOCX等视觉结构复杂的文档,包括含有表格、图表、手写批注的工程图纸、合同、理赔档案等内容。系统通过专有视觉模型将页面拆分为独立元素,再由智能体逐一处理,支持私有云、本地部署及气隙隔离环境,确保数据不离开企业自身基础设施。

Q2:企业的非结构化文档数据规模有多大?为什么大语言模型读不了?

A:据EyeLevel联合创始人Benjamin Fletcher介绍,企业约80%的知识存储在数以百万页计的PDF、PPTX和DOCX文件中。这些文档的信息量远超任何大语言模型上下文窗口的处理上限,导致大语言模型和智能体实际上无法直接访问这些内容。此外,人工构建的训练数据集通常存在10%至25%的错误率,进一步加大了AI处理此类数据的难度。

Q3:GroundX在实际企业场景中有哪些落地案例?

A:目前已有两个典型案例:一是法荷航集团(Air France-KLM)使用GroundX开发了AI客服助手,基于数千份政策文档进行训练,在复杂政策问题上达到96%以上的回答准确率;二是宠物医疗平台AskVet利用该平台整合了十余年的专有兽医数据,实现了高达85%的客户咨询自主解答,同时大幅提升了整体运营效率。

The New Stack