可穿戴设备能够在大规模人群中持续采集生理信号。这些数据流涵盖心率动态变化到睡眠模式等多个维度,有望在症状出现之前捕捉到早期生理变化。当前的瓶颈已不再是数据采集,而是如何将这些信号转化为可靠的、具有临床意义的生物标志物。
现有基于大语言模型的智能体系统能够自动化部分科学研究流程,但在处理生理时间序列数据时往往容易出现问题。这类系统通常只优化预测性能,而忽视统计有效性,导致出现虚假相关性、数据泄露和脆弱特征等问题。
为此,研究团队提出了生物标志物发现框架(Biomarker Discovery Framework),这是一个在人工监督下将候选生物标志物优先级排序构建为迭代研究循环的多智能体系统。通过将假设生成、并行统计分析、模型训练、对抗性验证与文献推理相结合,该框架在保持严格统计规范与人工监督的前提下加速了发现过程。在三个包含9279个参与者观测数据的队列研究中,该框架成功复现了已知临床信号,识别出跨独立数据集的收敛型生物标志物,并在与人口统计特征结合后提升了下游预测能力。
框架架构与运行机制
生物标志物发现框架将确定性计算(用于数值分析)与生成式推理(用于假设形成与解读)相结合。一个编排器智能体负责将自然语言研究指令分解为执行计划,并引导各专业智能体完成六个阶段的工作流程。与此同时,共享记忆、结构化事实表和通用工具确保了整个工作流程的可追溯性。
以一个具体示例说明:当系统收到"筛选与抑郁严重程度相关的可穿戴候选指标"这一请求后,框架对DWB数据集进行了分析,提出了睡眠时间变异性特征,并估算出睡眠时长变异性与PHQ-8严重程度之间存在关联(ρ = 0.252)。随后,工作流程对稳定性、数据泄露、子群体一致性及替代性解释进行了验证,最终将结果作为基于文献的昼夜节律不稳定性假设提交给人工审核。
该系统配备了安全机制以保障统计有效性,将特征构建与目标信号相分离,并要求候选指标通过包含11项检验的对抗性过滤阶段。
多队列验证结果
为评估该框架从噪声数据中提取合理生理洞察的能力,研究团队将其独立应用于三个大规模队列,总计9279个参与者观测数据,涵盖心理健康(DWB和GLOBEM)与代谢疾病(WEAR-ME)两个领域。该流程自主识别出41个心理健康候选数字生物标志物和25个代谢结局候选指标。
该框架不仅仅是对现有变量进行筛选,还构建了新型复合特征。例如,在心理健康领域,它识别出睡眠时长变异性和睡眠起始变异性是抑郁严重程度的主要相关因素;在代谢领域,它推导出心血管健康指数(步数除以静息心率)作为胰岛素抵抗的非侵入性相关指标,并将其与葡萄糖调节和心脏代谢健康方面的既有研究联系起来。
在两个抑郁症队列中,框架优先识别出了与昼夜节律不稳定性相关的不同操作化构念。在DWB队列中,睡眠时长变异性与PHQ-8严重程度相关(ρ = 0.252,p < 0.001);在GLOBEM队列中,睡眠起始变异性作为探索性低信号关联指标出现(ρ = 0.126,p < 0.001;CV AUC = 0.535)。由于两个队列的人群特征、终点指标和特征定义均有所不同,且无相同候选指标被复现,这一规律应被解读为构念层面的收敛性提示,而非直接复现。
将生物标志物发现框架衍生特征与人口统计变量结合后,预测性能有所提升(抑郁的ΔR? = 0.040,胰岛素抵抗的ΔR? = 0.021)。
专家盲评结果
为评估输出报告质量,来自医学、生物医学数据科学、机器学习、生物信息学和数字健康领域的15位专家,对生物标志物发现框架与三个同类AI研究系统(谷歌DeepMind的AI协作科学家、Biomni和谷歌ADK数据科学智能体)生成的盲评报告进行了审阅。
在盲评中,该框架在所有七个质量维度上均获得最高平均分,是唯一获得"接受"或"小修"推荐的系统,共获得2次接受、8次小修、8次大修和3次拒稿。审阅者平均估计会保留该框架生成报告内容的56.9%,而其他基线系统仅为18.8%至30.4%。在13次四系统排名中,该框架有9次排名第一。
总结
随着可穿戴健康数据持续扩展至更大规模人群,数字医疗的瓶颈已不再是数据采集,而是如何进行有原则、严格的假设生成。单纯提升模型能力无法解决科学严谨性的问题。然而,当AI部署于一个精心设计的架构中,将确定性计算与生成式推理相分离,并要求智能体对其研究结果进行对抗性辩论时,AI便能够在人工监督下支持结构化假设生成、验证与优先排序。通过从黑箱自动化转向透明的人机协同工作流程,我们得以构建能够安全加速临床研究中"假设到验证"周期的AI系统。
本文由谷歌研究院的Yubin Kim、Hamid Palangi和Daniel McDuff撰写。该研究由麻省理工学院博士生Yubin Kim在谷歌实习期间主导完成,由Daniel McDuff和Hamid Palangi提供指导。
Q&A
Q1:生物标志物发现框架是什么?它能解决什么问题?
A:生物标志物发现框架是一个多智能体AI系统,专门用于从可穿戴传感器数据中筛选候选生物标志物。它通过迭代式假设生成、统计分析和文献推理,解决了现有系统忽视统计有效性、容易产生虚假相关性的问题,同时保留人工监督机制,确保科学严谨性。
Q2:生物标志物发现框架在实际数据上的表现如何?
A:该框架在涵盖9279个参与者观测数据的三个大规模队列中进行了验证,自主识别出41个心理健康候选数字生物标志物和25个代谢结局候选指标。与人口统计特征结合后,抑郁预测的ΔR?提升了0.040,胰岛素抵抗预测的ΔR?提升了0.021。
Q3:生物标志物发现框架与其他AI研究系统相比有何优势?
A:在15位专业领域专家的盲评中,生物标志物发现框架在所有七个质量维度上均获得最高平均分,是唯一获得"接受"或"小修"推荐的系统。专家平均愿意保留其56.9%的生成内容,远高于其他基线系统的18.8%至30.4%,并在13次四系统排名中有9次排名第一。
