这期节目来自 Latent Space 播客,主持人与 Simile AI 联合创始人兼 CEO 朱恩·成·朴(Joon Sung Park)展开了一场深度对话。朱恩因 2023 年发表的"生成式智能体"论文(即"Smallville 论文")而广为人知,该论文在 Google Scholar 上已累计超过 7.2 万次引用,被许多人视为近年最重要的 AI 研究之一。如今,他正在将这项研究推向一个更宏大的目标:构建人类行为的基础模型,最终模拟地球上的全部 80 亿人。
朱恩的成长轨迹颇为特别。他在韩国出生,11 岁随父母移居波士顿——父亲是外科医生,在波士顿儿童医院做访问学者。他最初的志向是成为一名画家,高中时认真学习绘画,并将其视为未来的职业方向。转折点在于一个信念:"最伟大的艺术家往往会创造自己的媒介,而当下最好的媒介在于计算。" 这让他逐渐走向研究之路,2020 年进入斯坦福大学攻读博士。
1. 从"时间机器游戏"到 Smallville
2020 年,GPT-3 即将发布,斯坦福的一批学者——包括后来共同创造"基础模型"这一术语的 Percy Liang——聚在一起思考一个问题:这类新模型的杀手级应用究竟是什么?
朱恩和同事们玩了一个他们称之为"时间机器游戏"的思想实验:假设坐上时间机器,快进十年后回望,什么应用会是最重要、最令人振奋的?他们的答案是:"如果我们能重建我们所生活的世界呢?"
这个想法直接催生了后来的 Smallville 实验——在一个虚拟小镇里,AI 角色能够记忆、规划、社交,并涌现出自发行为。论文发表后引发广泛关注,成为 2023 年被引用最多的 AI 论文之一。
时间机器游戏中的"第二候选"是什么?是真正个性化的自动化助手——能替你做事的智能体。朱恩坦言这个方向同样令他着迷,但他当时的判断是:要造出真正有用的个人助手,前提是先造出对用户的深度模型。 如果你告诉助手"帮我订晚餐",它却点了你最讨厌的菠萝披萨,那说明它根本不了解你。而模拟,正是建立这种理解的基础。
2. 记忆架构:Markdown 文件的力量与局限
朱恩在 2022 年为生成式智能体设计记忆系统时,面临一个选择:是用知识图谱,还是训练专用模型,还是别的什么?
他们最终的决定出人意料地简单:把所有东西放进一个 Markdown 文件或文本文件,就这样。 理由是语言模型本来就擅长理解和推理文本,没必要引入额外的复杂结构。他注意到,今天许多个人助手产品(他提到了 ChatGPT 和 Claude 的记忆功能)采用的正是类似的直觉。
但这个方案有其天花板。当数据量极大时,如何检索、如何从海量文本中提取有效信息,依然是巨大挑战。更根本的问题是:有些东西,光靠提示词(prompting)是塑造不了的,必须触及模型的参数本身。
3. "社会物理学":为什么要动模型权重
什么情况下需要训练或微调模型,而不是仅仅提示它?朱恩给出了一个清晰的判断标准:当模型需要学习它所运行的世界的底层物理规律时。
他把这称为"社会物理学"(social physics)——人类行为背后的因果机制。现有的前沿大模型大量训练于网络数据,而网络数据捕捉的是人们"说了什么",而非人们"实际怎么做"。这是一个根本性的偏差。
Simile 的方法是通过长篇访谈、行为观察数据、交易数据,以及随机对照试验(RCT)来获取更真实的人类行为数据,然后在这些数据上对模型进行后训练(post-training)。目标是让模型不仅能预测人们会说什么,还能重现人们真实的决策逻辑——包括那些非理性的偏见和错误。
一个被优化为"理性"的模型,反而是对"非理性人类"的糟糕模拟。 这是朱恩反复强调的核心洞见。
4. 85% 的行为准确率意味着什么
Simile 已经为 1000 名真实用户创建了数字孪生,并在行为重现上达到了 85% 的准确率——即数字孪生对问题的回答,与真实用户自己的回答吻合度达到 85%,而真实用户自我重复的一致性也大约在这个水平。
这个数字的意义在于:它不是在预测未来,而是在重现人类行为的内在逻辑。朱恩区分了"模拟"与"预测"的不同——模拟的价值不在于告诉你未来会发生什么,而在于帮你理解如何塑造你想要的结果。
他援引了阿西莫夫《基地》系列中"心理史学"(psychohistory)的概念:在足够大的群体尺度上,个体的不可预测性会被统计规律所平滑,从而使宏观预测成为可能。Simile 的长期野心,正是在这个方向上——从个体级别的数字孪生,扩展到人口级别的模拟,最终回答那些真正困难的社会问题。
5. 80 亿人的模拟:气候变化能被解决吗
对话的最后,朱恩描绘了他真正的终极愿景:模拟地球上的全部 80 亿人。
他以气候变化为例。气候变化是社会科学家所说的"棘手问题"(wicked problems)——众多参与者有着相互竞争的利益,需要在极度复杂的条件下做出协调决策。如果我们能在模拟世界中测试不同的政策方案,找到那些反直觉的、能真正推动协调的路径,会怎样?
类似的问题还有:民主制度的稳定性、全民基本收入(UBI)的社会影响、产品上市前的用户行为预测。朱恩认为,模拟的核心价值在于在真实世界部署决策之前,先在虚拟世界中测试它。
这个愿景距离实现还有多远?朱恩没有给出时间表,但他相信,随着数据获取方式的成熟和模型后训练技术的进步,模拟的规模和精度都将遵循某种类似于 LLM 的扩展定律(scaling laws)持续提升。
朱恩·成·朴从一个想用计算创造新媒介的画家,走到了试图用 AI 重建整个人类社会的研究者。Smallville 实验证明了 AI 角色可以涌现出真实的社会行为;Simile 正在尝试证明,这种涌现可以被精确校准,直到它足够真实,足以帮助我们在现实世界做出更好的决策。那个关于 80 亿数字孪生的问题,或许比它听起来更近。
