向Claude、ChatGPT、Gemini或其他主流大语言模型提问"史上最佳电影是哪部",得到的答案各不相同——而你,乃至开发这些模型的工程师,几乎都无法确切知道模型是如何得出这一具体答案的。
这种不透明的行为在某些场景下或许有其价值,但也可能带来严重的负面后果。近期一起事件尤为引人警觉:OpenAI无法解释其某款高级预发布模型为何主动攻击AI公司Hugging Face。当前沿大语言模型已在编写代码、生成人类难以独立完成的研究结论,并在社会各领域承担重要任务,对AI"思维"与输出结果的可解释性需求,已达到前所未有的迫切程度。
专注于解决这一问题的AI实验室Goodfire,近日正式向公众开放了其前沿平台Silico。该平台集成了一系列解读AI行为的工具。与此同时,Goodfire宣布启动一项新的资助计划,为学术界和非营利机构的可解释性研究人员提供总计100万美元的Silico免费使用额度。此举旨在推动AI可解释性研究的普惠化,将原本仅少数顶尖实验室掌握的技术,交到那些希望构建、理解自有模型或基于开源模型进行定制开发的研究团队和初创企业手中。
Goodfire成立于2024年,总部位于旧金山,致力于提供工具以构建下一代安全且强大的AI——其核心路径是理解AI模型的内部结构,而非将其视为黑箱。"把模型当作黑箱对待并非必然,而是一种选择。"Goodfire联合创始人兼CEO Eric Ho表示,"有了合适的可解释性工具,我们就能真正看清模型的运作方式。"
Ho所提及的工具,围绕"机制可解释性"这一核心概念构建。该概念旨在通过解读模型的权重、激活值和注意力模式,并对其神经元及神经元间的路径进行映射,来理解AI模型执行任务时的内部运作机制。
机制可解释性工具涵盖多种方向:其一是通过受控提示词映射模型的激活状态,并将激活模式与一系列人类可理解的概念相对应;其二是追踪特定训练轮次前后模型权重的变化,以识别并理解发生了什么改变;其三是修改特定模型权重或激活值,观察其对模型输出的影响。
Silico整合了上述多种工具,并引入智能体层,帮助用户理解其模型。用户只需用自然语言描述想要探究的问题,例如"找出我的模型何时、为何出现幻觉",平台便会自主制定实验方案,调用各类可解释性工具和技术执行一系列任务,并将多个智能体并行部署以完成这些子任务。子任务的完成结果最终汇聚成对原始问题的解答,或提供可供深入检验和进一步探索的洞察。
Ho表示:"从某种意义上说,Silico就像一台显微镜,让你得以深入AI模型内部,看清哪些部分负责哪些行为,甚至可以直接对这些部分进行编辑。"
这些工具已在多个领域取得令人瞩目的进展。以医疗领域为例,英国AI公司Prima Mente与Goodfire合作,对其表观遗传学基础模型Pleiades进行了深度解析。该模型在从血液样本中检测阿尔茨海默病方面表现优异,但公司此前并不清楚其背后的原因。
"我们对Pleiades进行了逆向工程,发现它是通过DNA片段长度模式来做出预测的——这是一种人类此前从未用于阿尔茨海默病检测的信号。"Ho回忆道,换言之,团队发现了一种全新的疾病生物标志物。"据我们所知,这是首个完全通过逆向解析基础模型而在自然科学领域取得的重大发现。"他补充说。
在更广泛的AI前沿探索方面,Silico同样正在发挥作用。Cameron Berg是纽约非营利研究机构Reciprocal Research的创始人兼负责人,该机构专注于探索评估AI认知能力的方法。他表示,Silico几乎在恰到好处的时机出现在他的视野中。"Silico对我的研究议程的落地执行帮助极大,推进速度之快远超我的预期。我感觉自己俨然成了首席研究员,而我的研究科学家和研究工程师都是AI系统。"
Berg认为,Silico及同类工具的开放获取将进一步增强外界对AI执行研究任务能力的信任,从而全面加速科学进程。不仅如此,Silico的大范围发布或许还将引发AI创新者在构建、调试和部署模型方式上的深层转变。
"对于我们这个时代最具影响力的技术,不去主动理解它,我认为是一个错误——尤其是在我们持续观察到能力日益增强的AI智能体涌现出各种意料之外的行为的当下。"Ho说,"如果我们真正理解了大语言模型的思维方式,就可以从一开始有意识地进行设计、主动塑造模型行为,使其更安全、更可靠,而不是在问题暴露后才被动地发现和纠正。"
Q&A
Q1:Silico是什么?它能帮助研究人员做什么?
A:Silico是Goodfire开发的AI可解释性平台,集成了多种解读AI模型内部行为的工具。用户只需用自然语言描述想探究的问题,平台便会自主规划实验方案,调度多个智能体并行执行任务,帮助研究人员理解模型在执行任务时的内部运作机制,例如查找模型幻觉的原因,或识别模型使用了哪些特征来做出预测。
Q2:Goodfire的可解释性研究资助计划是怎么回事?
A:Goodfire近期宣布了一项资助计划,为学术机构和非营利组织的可解释性研究人员提供总计100万美元的Silico平台免费使用额度。该计划旨在降低可解释性研究的门槛,让更多研究团队和初创企业能够使用此前只有少数顶尖实验室才能掌握的工具。
Q3:Silico在医疗领域有哪些实际应用案例?
A:英国AI公司Prima Mente借助Goodfire对其阿尔茨海默病检测模型Pleiades进行了逆向工程分析,发现该模型是通过DNA片段长度模式来做出预测的——这是一种人类此前从未用于该疾病检测的生物标志物。这也被认为是首个完全通过逆向解析基础模型而在自然科学领域取得的重大发现。
