AI正在改变我们周围的一切,但迄今为止,它在很大程度上仍局限于数字领域。然而,越来越多的初创公司正寻求将其带入现实世界。

Perceptron是其中一家,由两位前Meta研究科学家创立。该公司成立于2024年11月,专注于开发前沿视觉模型,旨在帮助机器更有效地与物理环境交互。

本周,该公司发布了最新模型Isaac 0.5。据其创始人介绍,该模型旨在赋予机器在工业场景中"感知、推理和行动"的能力。具体而言,这款软件能够帮助视觉引导机器人在仓库或工厂车间等复杂环境中导航,同时还能帮助企业从机器人录制的视频中提取视觉智能。

Isaac 0.5以开放权重模型的形式发布,任何人都可以查看其参数和训练材料。

该初创公司近期完成了一轮由贝塞默风险投资领投的2100万美元融资,由Armen Aghajanyan和Akshat Shrivastava联合创立,两人此前均供职于Meta基础AI研究院(FAIR)。他们将自己的软件视为工业自动化部署的未来方向。

"当前的物理AI强迫用户做出一个错误的选择:要么是每个实例都需要多块专用云端GPU的通用基础模型,要么是只能处理感知或控制、但无法兼顾两者的专用模型。"该公司表示。

Aghajanyan和Shrivastava认为,他们的工具与现有模型的不同之处在于其通用性——它并非为某一特定的重复性任务而构建,而是能够根据所处的具体环境或情境灵活适应。

在一次采访中,Shrivastava请我思考一个简单的物理流程——整理箱子——背后究竟涉及哪些步骤:"想象一下,现在有一台机器人被部署来分拣包裹,它需要完成哪些任务?"

这个看似简单的任务实际上包含许多步骤:机器人首先需要读取包裹上的标签,进行空间分析以判断箱子的位置,再决定拿取哪一个。如果需要依次搬运多个箱子,还必须规划拿取顺序。

Perceptron的软件正是为帮助机器人完成上述每个步骤而设计的。诚然,业界已有软件能够帮助机器完成其中大部分任务,但能够灵活应对全流程的程序却寥寥无几。

这种算法能力的数据从何而来?

Isaac 0.5这类模型通过摄取海量视频训练数据来习得操作技能。Perceptron表示,新模型使用了100万小时的通用视频进行训练,以帮助算法识别特定场景、画面和情境。此外,公司还大量使用了"第一视角视频"——通常通过GoPro或可穿戴摄像头,从完成物理任务的人的视角拍摄——以及UMI视频,后者同样通过记录人类重复动作来训练AI系统的运动能力。

尽管Perceptron未披露训练数据的来源,但Shrivastava表示,公司"内部构建了PB级数据集,涵盖图像、文本、视频等多种模态,直至机器人运动轨迹"。

能够帮助机器人在仓库中高效运作的软件,其应用价值显而易见。Perceptron认为自己已做好充分准备,引领这波自动化浪潮。该公司正积极向各类厂商推广其软件,有望将其智能层集成到制造、物流与仓储、安防、出行以及媒体与娱乐等多个行业。

"市场上真的没有类似的产品,"Aghajanyan说,"我们对此感到非常兴奋。"

Q&A

Q1:Isaac 0.5是什么模型?它有哪些核心能力?

A:Isaac 0.5是Perceptron公司发布的工业视觉AI模型,能够帮助机器人在仓库、工厂等复杂环境中实现感知、推理和行动。与现有专用模型不同,它是通用型设计,可灵活适应不同场景,同时兼顾感知与控制两大能力。该模型以开放权重形式发布,任何人均可查看其参数和训练材料。

Q2:Isaac 0.5的训练数据来自哪里?

A:Isaac 0.5使用了100万小时的通用视频进行训练,同时大量采用第一视角视频(通过GoPro等可穿戴设备拍摄)和UMI视频(记录人类重复动作)。Perceptron内部构建了PB级多模态数据集,涵盖图像、文本、视频及机器人运动轨迹,但具体数据来源未对外披露。

Q3:Perceptron的目标市场有哪些?

A:Perceptron面向多个行业推广其视觉AI软件,包括制造业、物流与仓储、安防、出行以及媒体与娱乐。公司希望将其智能层广泛集成到各类厂商的产品中,成为工业自动化部署的核心基础设施。

TechCrunch - AI