要点:

分布式计算包括手掌中支持AI的MCU/NPU,用于预处理手指数据,而集中式计算系统通常配备GPU,通过基于FPGA的传感器桥接和以太网处理来自所有传感器的原始输入。

混合架构是适应各类机器人应用所必需的,其中一些应用将采用云连接的大语言模型和视觉-语言-动作模型,另一些则受益于针对性的小语言模型。

多样化的传感器、模型和连接选项造就了广泛的攻击面。最坏情况可能包括中间人攻击,被入侵的大语言模型利用自然语言界面操纵老人和儿童等弱势群体。

机器人和人形机器人市场在工业应用领域正快速增长,但如果电池续航能够超越目前的几小时限制、成本能够降低,且这些系统能够抵御黑客攻击,市场增长速度将大幅提升。

根据Robotics Center的一份报告,2026年美国机器人销售额达到114亿美元,同比增长29%。亚马逊机器人目前在美国市场占据主导地位,其他公司也在争夺未来市场份额,包括Figure AI、Agility Robotics、Apptronik、特斯拉(Optimus)、波士顿动力、Physical Intelligence(Pi)、1X Technologies、Covariant和Skild AI。该报告指出,这些公司将AI、视觉-语言-动作模型(VLA)和基础模型作为核心架构要素,它们并非在传统机器人上改装AI,而是将AI本身作为产品,硬件仅是交付载体。

某些人形机器人的芯片架构类似于软件定义的自动驾驶汽车,采用分布式区域计算;另一些则类似无人机,采用集中式计算。所有机器人的共同点是采用由MCU、MPU、CPU、GPU、图像信号处理和数字信号处理组成的异构架构。

英飞凌科技人形机器人系统架构师罗纳德·斯塔尔茨表示:"人形机器人计算很可能采用混合模型,即强大的中央处理系统配合分布式或区域计算,用于预处理来自手指等部位的数据。这与汽车行业已经历的转变相似,即从集中式ECU转向区域架构,驱动因素是延迟、带宽和容错要求。人形机器人正走向同样的结论。该架构包含两个层次——中央AI单元负责高层推理和规划,专用微控制器在主计算层面充当其安全伙伴。关节层面的分布式微控制器负责实时处理和局部驱动。安全性绝不能仅依赖AI模型本身,必须由独立的、经过认证的硬件组件来实现。整个系统的性能最终取决于其芯片。"

其他业内人士也认同混合架构可能成为主流。MIPI联盟物理AI兴趣小组主席埃多·科恩表示:"集中式计算可能最适合全局感知、场景理解、任务规划以及整个机身的协调,而分布式局部计算可能在超快速局部控制回路方面更具优势,例如手部、足部、平衡系统、触觉反馈和碰撞规避所需的控制。在混合架构中,中央处理器决定更高层次的任务——要抓取什么物体、移动到哪里、如何排序动作——而机器人手部内的局部计算则执行实时推理,在毫秒内调整握力。然而,从物料清单、功耗和系统复杂性的角度来看,采用利用高速接口的集中式计算架构可能是更高效的方法,因为它可以减少组件数量、简化系统集成并精简软件开发。我们预计市场将根据具体用例需求和未来技术进步,采用集中式和混合架构的组合。"

在人形机器人中,输入来自多模态传感器,包括摄像头、麦克风、雷达、激光雷达、超声波传感器,以及磁性、电容式、电阻式等各种触觉传感器。

随着人形机器人细分领域的发展,触觉传感尤其在不断进步。Cadence公司Tensilica产品汽车产品管理总监阿米特·库马尔表示:"早期的机器人系统,比如老款Roomba,使用简单的碰撞传感器,其功能类似开关,根据碰撞类型触发不同反应。例如,撞到坚硬墙壁可能导致45度转弯,而撞到较软的障碍物则可能只产生较小的调整。然而,人形机器人需要更加精密和灵敏。自适应操控使机器人能够牢固抓握物体而不会将其压碎或滑落。指尖的触觉传感器持续提供施力大小的反馈。"

集中式计算方法使用与分布式系统相同类型的前端传感器,只是它们不具备AI能力,是"哑"传感器而非"智能"传感器。

德州仪器机器人与工业自动化总经理乔瓦尼·坎帕内拉表示:"你可以事后融合数据,从每个传感器中获取最佳信息。归根结底,你希望这些机器人像人类一样,所以空间非常有限。不带边缘AI处理的小型传感器让你能够添加更多传感器,以提升感知和安全性。将处理集中在一处有助于实现小型化,以适应机器人的外形尺寸,并有助于功耗和电池续航。如果你在传感器旁边配置大量小型处理器,它们都会耗电。GPU也会消耗大量电力,但随着你添加越来越多的[哑]传感器,你就把功耗转移到了一个地方,然后可以集中优化。"

原始传感器数据可以流式传输到基于FPGA的传感器桥接器(如英伟达的HoloScan),后者通过以太网将其打包传输。坎帕内拉说:"然后,真正的处理就在GPU中发生,那里会有AI模型接收来自传感器的原始数据,并基本上感知正在发生的一切——机器人路径上的物体、路过的行人、儿童、宠物和高速移动的物体。"

然而,选择架构不仅仅涉及AI加速。Synaptics战略与业务发展高级总监内布·菲利普斯表示:"这是整个流程。你引入一个数据流,进行解码,因此内置了硬件解码器;或者你可以使用CPU进行软件ISP处理。这取决于你在进行什么类型的处理、聚合点在哪里,以及你讨论的是人形机器人设计还是协作机器人和服务机器人。没有放之四海而皆准的方案。如果你看看英伟达最新的SDK发布,他们谈到在不同区域进行一定量的推理,比如HoloScan之类的东西。他们提供API连接到更大的处理框架。是否必须简单地将每个功能都发送到冷GPU?不是的。他们允许这些桥接功能,让你能做更多事情,使整体架构更具可扩展性和效率。这就是我们目前在这个市场演进阶段所处的位置。"

分布式计算:从云端到机器人再到肢体

与边缘计算领域的许多方面类似,机器人技术也在本地化AI处理和云端之间切换。人形机器人可能连接云端,用于大语言模型和其他形式AI(如视觉-语言-动作模型)的持续训练,但边缘AI处理带来诸多好处。

Imagination Technologies产品管理总监马修·布比斯表示:"两种方法都会一直被采用,这取决于公司的优先级平衡。他们是否希望完全掌控自己的系统并保护数据隐私?他们是否希望控制内部成本以及具体的计算机运行设计和方式?如果他们想要这一切,那么他们会选择本地边缘解决方案。而如果该公司提供的是一个机器人和系统网络,运行在能够良好访问数据中心的环境中(无论是有线还是无线),并且如果他们必须进行无法本地化的高强度计算操作,那么他们更有可能选择基于数据中心的解决方案。这真的取决于特定公司参数的平衡以及他们的优先级。本地或集中式AI处理永远不会有放之四海而皆准的解决方案。"

人形机器人安全与自动驾驶汽车的对比

人形机器人和自动驾驶汽车都是发展迅速、机会众多的应用领域,但各自面临的风险不同。

英飞凌的斯塔尔茨表示:"人形机器人带来了与自动驾驶汽车不同的安全风险。物理接近性是关键区别。汽车在一个限定的领域内运行,而人形机器人在家庭、医院和学校中运行,与人直接接触。在这种环境下,受损系统会带来直接的人身后果。功能安全与网络安全的融合至关重要。对数字系统的网络攻击造成的是数据损失,而对具备物理能力的机器人来说,可能造成人身伤害。这些学科必须在芯片层面共同解决。英飞凌在芯片层面内置安全性,而不是事后作为软件层添加。我们的芯片为机器人提供内置身份、安全启动、受保护的密钥存储和加密通信。我们的产品组合还具备后量子密码学就绪能力,并符合欧盟网络弹性法案、欧盟AI法案和通用标准。网络安全认证不是障碍,而是公众信任的基础。"

人形机器人与汽车存在分歧的一个领域是AI感知安全。新思科技产品管理高级总监达娜·纽斯塔德表示:"你确实需要保护模型完整性。如何安全地加载AI或进行AI更新,并能够实现运行时保护?相较于汽车,这类机器人的责任和合规问题会更加复杂,而且理应如此。两者都属于物理AI,但人形机器人增加了另一层复杂性。技术发展速度如此之快,以至于监管和治理都跟不上,而地缘政治局势使情况变得更加复杂。"

图1:工厂环境中的人形机器人。来源:新思科技

人形机器人属于物联网设备,因此与标准和法规相关的既有经验依然适用。Cadence旗下Secure-IC首席技术官兼联合创始人西尔万·吉莱指出:"由于人形机器人的人类外形,它们不被视为物联网技术,这意味着新的风险可能来自逼真骗局导致的信息窃取,以及真实授权代理与机器之间的混淆,包括短距离窃听和身份冒充在内的隐私侵犯。"

人形机器人黑客攻击可能延伸当前的电话和电子邮件诈骗手法。吉莱表示:"例如,AI可以给我打电话,假装自己是真正的供应商。我信任你是因为你听起来很自然。如果我们进行非常流畅的互动,但突然间你换了头像,现在你看起来像我的老板,我就会把所有信息都给你。这是人形机器人带来的真实威胁。我们往往会信任它们,因为机器与人之间的差异变小了。将来会越来越难以辨别你面对的到底是什么。"

例如,虽然最后一公里配送机器人看起来很可爱,但它们很容易变成间谍。吉莱说:"在新冠疫情期间,每个人都开始使用Zoom,结果发现有些人能够连接进来并偷听、监视讨论。如果我们进行电话会议,你怎么能确定加入的人是谁呢?AI会非常巧妙地进行互动,并保持足够的谨慎,让人相信它是真人。我已经看到有人在暗网上操纵头像进行交易,那些头像是由真人驱动的,并且理解他们所处的情境。"

机器人芯片系统的所有层级都容易受到攻击。吉莱表示:"这涉及所有层级,因为要实现智能,你需要芯片的算力,你需要芯片上的推理和芯片上的强化学习。人之所以为人,是因为能够保持相关性,考虑到上下文,所以你需要模型具备自我强化的能力,这就需要计算能力。而操纵则会更多地发生在更高的层面——即你如何组合你的智能体、你如何提示你的智能体去做什么,这种情况会发生。这已经不再是科幻小说的内容了。"

其他威胁面

视觉是另一个攻击面。纽斯塔德表示:"视觉直接输入到控制、操纵以及机器人必须做出的所有决策中,你可以做很多事情来利用摄像头固件,例如模型层面的攻击,通过空中更新进行数据投毒,或造成隐私泄露。你可能会导致机器人的操作变得极度不安全,让它抓取错误的物体,走入危险空间,或做出不安全的动作。"

Wi-Fi和无线通信同样存在风险。纽斯塔德指出:"这很危险,因为这是一种远程架构。它需要合法认证,而且容易遭受中间人攻击或空中固件投毒。其影响是,攻击者可以完全接管机器人,发送指令并对其施加影响。"

这些通信风险凸显了为什么认证不能依赖单一信号或交互渠道。

这使得多模态认证成为一项重要保障。Synaptics物联网与边缘AI处理器业务副总裁兼总经理约翰·韦尔解释说,需要第二种模态。"仅靠语音是不够的。你可以加入触摸事件,可以加入指纹,或摄像头加语音。这有助于身份识别和情境判断。机器能够看到你的眼睛,知道你在场。"

结论:灵活性是关键

开放标准使更多机器人开发者更容易参与到这场充满障碍、依然开放的竞赛中。

科恩表示:"MIPI的规范提供了架构灵活性。人形机器人开发者可以利用同质化的标准化嵌入式接口组合,这些接口能够提供各类应用领域所需的速度、延迟、功耗效率、热性能、安全性和可靠性——无论是视觉、显示、执行器控制还是闪存存储。除了满足技术系统要求外,标准化接口还能提高供应商的互操作性和选择空间,改善规模经济效益,并缩短开发周期。"

另一个选择是开放标准RISC-V。GlobalFoundries旗下MIPS营销主管詹姆斯·普赖尔表示:"客户问的不是何时采用RISC-V,而是如何采用RISC-V。他们该与谁合作?如果把机器人技术类比为汽车和工业领域,这些领域以敢于冒险著称吗?航空航天从业者是冒险家吗?不是,因为按定义,他们手中掌握着人的生命。他们不想冒险实验,这就是为什么他们想要软件定义架构、软件优先方法、基于开放标准的技术和充满活力的生态系统。"

企业没有采取硬件优先的方式,而是转向软件优先思维。普赖尔说:"通常,公司先建造硬件,然后再建立虚拟模型,说'这就是我们所建造的模型'。而应该反过来,'这是我们想要建造的模型,现在让我们把它变成实物'。从逻辑上讲,这才是正确的做法,因为虚拟模型比实物更容易更改,更新成本也更低。"

人形机器人开发者必须明确目标和最终应用,这能确保他们选择正确的架构,避免过度设计或设计不足。TI的坎帕内拉表示:"对于人形机器人或移动机器人来说,这一点极其重要,因为过度设计可能意味着你的机器人30分钟就没电了,那投资回报就没了。你可以配置两三个GPU,也许你的机器人能做任何事,非常了不起,但结果15分钟就耗尽电力,或者成本高到你根本负担不起,那你就再也卖不出这款机器人了。架构取决于机器人将被部署在哪里。你希望你的机器人做什么?你要根据这些需求来设计机器人。"

至少目前来看,没有一种方案能适用于所有情况。坎帕内拉表示:"有太多因素会影响结果——多少传感器、多少摄像头、机器人的灵巧程度。很难简单地说哪种芯片该用在哪里。"

Q&A

Q1:人形机器人的计算架构是集中式还是分布式?

A:人形机器人计算很可能采用混合模型,即强大的中央处理系统配合分布式或区域计算,用于预处理来自手指等部位的数据。中央AI单元负责高层推理和规划,而关节层面的分布式微控制器负责实时处理和局部驱动。

Q2:人形机器人相比自动驾驶汽车面临哪些独特的安全风险?

A:物理接近性是关键区别。汽车在限定领域内运行,而人形机器人在家庭、医院和学校中与人直接接触,受损系统会带来直接的人身后果,因此功能安全与网络安全的融合在人形机器人中更为关键。

Q3:为什么说人形机器人可能被用于欺诈或间谍活动?

A:由于人形机器人具有类人外形,人们更容易信任它们,这使得被入侵的AI系统能够通过自然语言界面冒充真人进行欺诈,或利用逼真的外观进行隐蔽的信息窃取和窃听,风险大于普通物联网设备。

Semiconductor Engineering