又一位数学家对OpenAI提出质疑,指责其在近期一系列重大数学突破背后使用的数据来源不透明。就在关于该公司模型是否受益于未发表研究成果的争议爆发几天后,第二位数学家也站出来指责这家AI巨头行为不道德且"不诚实",并批评其在训练数据来源方面缺乏透明度。
数学家安德里亚斯·托姆(Andreas Thom)在Mastodon上发布的一系列帖子中表示担忧,他和同事们在OpenAI宣布重大成果之前与ChatGPT聊天机器人的互动,可能对该公司在这一领域的成功有所贡献。上个月OpenAI高调宣布的10项成果中,有一项恰好属于托姆的专业领域——所谓的非索菲克群(non-sofic groups),OpenAI也承认该成果在很大程度上建立在托姆与另一位数学家加博尔·孔(Gábor Kun)此前工作的基础之上。
托姆表示,他开始反思自己与OpenAI的互动,是在纽约大学数学教授特里斯坦·巴克马斯特(Tristan Buckmaster)公开质疑OpenAI的AI模型是否受益于他使用Codex的经历之后。OpenAI宣布非索菲克群成果后,因未能致谢托姆和孔近期的贡献而在数学界受到广泛批评,该公司随后悄悄修改了相关说明文章。非索菲克群,简单来说,是指无法用有限结构近似的无限数学结构。
托姆表示,令他印象深刻的还有"OpenAI对我们所用技术的详细掌握",他说这些技术在当时既非最显而易见、也非最有希望的解题路径。他表示曾致信OpenAI研究员塞巴斯蒂安·布贝克(Sébastien Bubeck)以及同时担任哈佛大学统计学家的马克·塞尔克(Mark Sellke),询问他与ChatGPT的互动是否"属于训练数据的一部分,或可被推理过程访问",从而可能对该成果有所贡献。
但这一回复并未让托姆满意,他表示对方的回答只涉及他与聊天机器人的对话是否可被直接访问,而未回应这些对话是否已被纳入该公司用于改进模型的庞大训练数据池。"没有给出任何这样的说明、解释或证据,"他写道,"我认为这至少可以说是不诚实。"
托姆表示,研究人员没有能力对OpenAI的训练流程进行逆向工程,以判断自己的研究成果是否被使用过。"只有OpenAI掌握相关数据。"他表示,如果该公司要否认这样做过,那么举证责任应在于他们,需要通过披露所有必要的数据集,并阐明各项设置和条款来证明自己使用数据的方式。
OpenAI不愿彻底排除使用用户数据的可能性,这与其此前为千禧年大奖难题突破进行辩护的方式如出一辙,无论是在公开声明中,还是在与巴克马斯特的沟通中——后者当时正以个人身份与Anthropic研究员莱文特·阿尔珀格(Levent Alpoge)共同研究该问题。在宣布纳维-斯托克斯方程(涉及流体运动)求解成果的博客文章中,OpenAI明确否认使用了任何特定用户数据:"我们(研究人员和智能体)在他们公开发布之前,未曾以任何方式看到过他们的研究成果——尤其是,为解决这一问题并未访问任何特定用户数据。"
但该公司并未彻底排除间接影响的可能性:"尽管可能性不大,但我们无法排除源自用户使用我们产品、经过去标识化处理的数据,可能有助于改进我们模型的情况。"托姆表示,这与该公司在与他沟通时所采用的含糊说辞如出一辙。"去标识化可能会去除姓名,但不会去除数学思想的知识内容,"他说。
鉴于近期事件,托姆表示:"塞尔克给出的斩钉截铁的答复,至少可以说是没有根据地过于宽泛、并具有实质性误导性;现在回过头看,那显然是不诚实的。"
托姆表示,如果用户提供的非公开研究成果帮助改进了模型,而该公司随后利用这些模型在未经同意、未适当披露或未给予credit的情况下,与这些用户本人展开发表竞赛,那将"在伦理上站不住脚"。
截至发稿,OpenAI未立即回应The Verge的置评请求。
托姆的言论,进一步加剧了数学界对OpenAI日益增长的不安情绪,而这本应是该公司值得庆祝的高光时刻。该公司宣布攻克数学界传奇难题——千禧年大奖难题之一,这是一项非凡的成就,如果得到验证,几乎无人会否认其价值。但令情况复杂化的是OpenAI所说的促使其最初着手研究该问题的特殊情形:该公司称,他们在网上听到传闻,称其他研究人员在该问题上取得了重大进展,于是也决定尝试一番。
这一持续发酵的事件,让数学家们心生不快。多位研究人员告诉The Verge,他们担心这类行为会让整个学科变得更加保密,因为数学家们意识到,即便只是自己接近重大突破的传闻传出,也可能引发与一家资源雄厚、渴望荣誉的科技巨头之间的竞赛。
Q&A
Q1:OpenAI被指控使用了哪些数学家的研究成果?
A:数学家安德里亚斯·托姆和加博尔·孔关于非索菲克群的研究成果,被指可能未经致谢就被OpenAI在其宣布的突破性成果中使用,该公司随后修改了相关说明文章。
Q2:OpenAI对使用用户数据的指控是如何回应的?
A:OpenAI否认在解决问题过程中访问了特定用户数据,但承认无法完全排除去标识化数据可能有助于改进其模型,这一表态被数学家批评为含糊其辞。
Q3:这一争议会对数学界产生什么影响?
A:多位研究人员担心,这类事件会让数学界变得更加保密,因为担心即便是接近重大突破的传闻,也可能引发与资源雄厚的科技巨头之间的竞赛。
