近日,我院邹华春教授课题组首次在大规模、跨疾病、跨国家的法定传染病监测场景中,对经过低秩适配技术(LoRA)微调的大语言模型开展系统性预测基准评估。研究论文“Large language models as versatile predictive engines for notifiable infectious diseases”于近日发表在国际期刊《PLoS Digital Health》。

长期以来,传染病预测主要依赖ARIMA、指数平滑等统计方法,以及XGBoost、长短期记忆网络等机器学习模型。这些模型各有所长,但面对真实传染病监测数据时,仍会遇到多重挑战。不同疾病的传播机制差异显著,病例序列同时存在季节性、非线性、长期依赖、突发流行和稀疏计数等复杂特征,模型往往难以保持稳定表现。研究团队由此提出一个关键问题:作为通用人工智能基础模型的大语言模型,能否从复杂的传染病监测序列中学习时间依赖关系,并成为一种具有广泛适用性的预测引擎?
为回答这一问题,团队收集了中国国家法定传染病报告系统2009年1月至2025年2月的月度病例数和死亡数,以及美国国家法定传染病监测系统2016年至2023年的月度病例数。经过预设标准筛选,研究最终纳入中国32种传染病的病例和死亡预测任务,以及美国47种传染病的病例预测任务,共形成111项疾病—结局预测任务。疾病覆盖肠道传染病、血源性传染病、艾滋病及其他性传播疾病、呼吸道传染病、动物源性传染病等多个类别。团队以拥有30亿参数的 Qwen-2.5-3B为基础模型,对其语言生成架构进行了面向流行病学预测的重新设计,构建出一套由语义编码、时间嵌入、参数高效微调和数值回归共同组成的混合人工智能系统。研究团队将大语言模型与六类经典预测方法进行了直接比较,包括ARIMA、TGARCH、EGARCH、ETS四种统计模型,以及XGBoost和LSTM两种机器学习模型。每条疾病时间序列均严格按照时间顺序划分为60%的训练集、20%的验证集和20%的测试集,保证测试数据全部发生在模型训练和调参完成之后,避免未来信息泄漏。

研究流程图
在111项任务的汇总分析中,七类模型的预测表现存在显著差异。大语言模型相对于ARIMA、TGARCH、EGARCH、ETS、XGBoost和LSTM的平均排名差均为正值。其中,大语言模型相对于XGBoost的优势达到统计学显著水平。进一步分析发现,大语言模型的优势在不同传播类别中并不完全相同。在动物源性传染病中,大语言模型相对于所有对照模型的平均排名差均为正,相对于XGBoost的优势达到统计学显著水平。在肠道传染病中,大语言模型相对于TGARCH和EGARCH同样表现出显著优势。这两类疾病通常受到季节、气候、动物宿主、环境暴露、食品和饮水安全等多重因素影响,监测数据可能同时包含长期趋势、非线性变化和复杂周期。Transformer的多层自注意力机制和高维表征空间,可能更有能力拟合这种难以由固定统计结构概括的动态规律。
为了揭示大模型的决策依据,研究团队进一步分析了Transformer(大语言模型架构)最后一层的自注意力分布。结果显示,在不同疾病类别中,模型始终将最高的注意力权重分配给日期信息,其次是预测结局,随后才是疾病名称。这说明模型并非依靠疾病名称进行简单匹配,而是在持续学习年份和月份所承载的季节规律、长期趋势和历史阶段差异。对于艾滋病及其他性传播疾病、血源性疾病,模型对日期信息的关注度相对更高;对于肠道传染病,模型则向疾病名称分配了更多注意力,显示不同传播类别可能激活不同的内部表征路径。
大语言模型应用于公开监测数据时,一个不可回避的问题是:模型是否可能在预训练阶段已经见过这些数字?研究团队为此进行了专门的预训练数据污染敏感性分析。研究人员加载未经任务微调的原始Qwen-2.5-3B模型,让它直接根据月份、疾病和结局进行零样本预测。结果显示,未经微调的基础模型产生了极大的预测误差和异常值,表现远逊于经过LoRA监督学习后的模型。这说明正式模型的预测能力主要来自针对每种疾病和结局开展的任务特异性训练,而不是简单复述预训练语料中可能出现过的监测数字。
总之,这项研究表明,在传染病预测领域,大语言模型提供了一种效果可比的、更具扩展性的基础架构。这为大语言模型从文本生成工具走向专业数值预测引擎提供了新的方法学证据,也为未来建立能够融合多源公共卫生信息的人工智能预测系统奠定了基础。
复旦大学公共卫生学院博士生吴昕晟、硕士生武巾媛为该论文的共同第一作者,复旦大学公共卫生学院邹华春教授为该论文的通讯作者。该研究得到了新发突发与重大传染病防控国家科技重大专项(2025ZD01905200)、国家重点研发计划(2023YFC2306700)、国家自然科学基金面上项目(82574167)的资助。
文章链接:https://journals.plos.org/digitalhealth/article?id=10.1371/journal.pdig.0001527
文章引用:Wu X, Wu J, Wang Z, Feng X, Yao Y, et al. (2026) Large language models as versatile predictive engines for notifiable infectious diseases. PLOS Digital Health 5(7): e0001527. https://doi.org/10.1371/journal.pdig.0001527
我院余勇夫/秦国友团队在高维因果中介分析方法领域取得进展
复旦大学公共卫生学院启动建设数智健康便民研究院
赋能科学决策与临床实践——《卫生技术评估理论与实践能力提升项目》国家级医学继续教育培训班在沪成功举办
复旦大学公共卫生学院老龄健康研究中心亮相第五届老年病防控与健康会议
国家卫健委卫生技术评估重点实验室(复旦大学)参加2026年HTAi年会
第五期世界卫生组织专题网络研讨会顺利举办
复旦大学王颖教授团队在《The Journal of Prevention of Alzheimer's Disease》发表社区认知障碍多领域干预实施研究方案
我院陈英耀教授荣获中国卫生政策与管理学会(CHPAMS)胡德伟卓越导师奖(Teh-Wei Hu Inspiration Award)