ML-PDRESEARCH NOTES / 02

METABOLOMICS × MACHINE LEARNING

从代谢特征,
走向可检验的研究。

围绕健康对照、前驱期与帕金森病的分类问题,
把数据、实验和结论之间的每一步交代清楚。

受试者隔离训练与测试不交叉
嵌套验证调参与评估分开
可追溯结果配置、划分与版本留痕
项目概览

4 个分类任务 · 7 个对照模型。从数据接入、特征筛选到模型评估与结果可视化,构建一套可复现的研究流程。

01 / RESEARCH DESIGN

从输入到评估,完整记录。

完整方法说明 ↗

以受试者为单位组织训练与评估,在统一的数据处理流程和划分方案下比较模型,让每一步实验都有清晰的配置与记录。

  1. 01

    明确数据契约

    显式列出特征、标签和受试者标识,先排查重复、错误标签与缺失问题。

  2. 02

    内层学习与选择

    在每个训练折内重新完成过滤、填补、标准化和 RFE,再选择模型参数。

  3. 03

    外层只做评估

    对未见样本预测一次,保留各折结果与划分指纹,观察表现和变动。

02 / EXPERIMENT EXPLORER

把结果打开看。

数据来源:合成演示集

切换分类任务与比较指标,查看模型的整体表现,再深入观察逐类识别结果与特征选择。默认从逻辑回归开始探索。

正在读取已执行的实验结果…

03 / REPRODUCE THE WORK

从一条命令,回到每一步。

安装与完整命令 ↗

先用演示数据走通流程

安装仓库的锁定环境后,生成合成样例。运行四个分类任务,结果、图表与审计记录落在独立目录。

接入真实数据的要求 →
TERMINAL / PYTHON 3.12
mlpd demo --output data/demo
mlpd run --data data/demo/synthetic.csv --schema data/demo/schema.json --output runs/quick --models dummy logistic --outer-folds 3 --inner-folds 2
04 / PROJECT DELIVERABLES

让研究过程,
成为可复用的成果。

实验工作流

从数据校验到嵌套评估,通过统一命令执行实验,保存配置、划分与指标。

结果可视化

模型对照、逐类 ROC、混淆矩阵与特征入选频率,支持交互查看和独立图表下载。

代码与文档

模块化 Python 实现、Notebook 复现教程和完整研究指南,方便阅读、复用与扩展。