英国生物银行标准化表型代码的目的与住院的患者有关,但对于许多在门诊环境中接受治疗的患者缺失但缺失。我们描述了一种表型识别方法,该方法为所有英国生物库参与者施加了表型代码。材料和方法POPDX(基于人群的客观表型通过深度推断)是双线性机器学习框架,用于同时估计1,538个表型代码的概率。我们从英国生物库中提取了392,246个人的表型和健康相关信息,以进行POPDX开发和评估。共有12,803个ICD-10患者的诊断代码被转换为1,538个Phecodes,作为黄金标准标签。对POPDX框架进行了评估,并将其与自动多型识别的其他可用方法进行了比较。结果POPDX可以预测训练中罕见甚至未观察到的表型。我们证明了22种疾病类别的自动多型识别及其在识别与每种表型相关的关键流行病学特征方面的应用。结论POPDX有助于为下游研究提供明确定义的队列。这是一种通用方法,可以应用于具有不同但不完整数据的其他生物库。
translated by 谷歌翻译