三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

胆管癌数据集:用于胆管癌早期预测与分类的临床数据集

胆管癌数据集:用于胆管癌早期预测与分类的临床数据集

摘要:胆管癌临床风险评估与分期分类数据集(是一个综合性的临床表格数据集,专门开发用于支持使用机器学习和深度学习技术进行胆管癌(胆道癌)早期预测和多类别分类研究。

数据集简介

数据集概述

胆管癌临床风险评估与分期分类数据集(Cholangiocarcinoma Clinical Risk Assessment and Stage Classification Dataset, CCRASD-40K)是一个综合性的临床表格数据集,专门开发用于支持使用机器学习和深度学习技术进行胆管癌(胆道癌)早期预测和多类别分类研究。

数据集包含 40,000 条独特的患者记录和 50 个结构化临床属性,涵盖患者人口统计学、生活方式因素、家族史、病史、临床症状、肝功能检测结果、肿瘤生物标志物、影像学发现和疾病标签。数据集以 CSV 格式提供(UTF-8 编码),无缺失值、无重复记录,包含唯一患者标识符以确保数据一致性和完整性。目标变量 Disease_Class 将每条记录分为五个临床相关类别:健康(Healthy,10,000条)、低风险(Low Risk,9,000条)、早期胆管癌(Early Cholangiocarcinoma,9,000条)、中期(Intermediate Stage,6,000条)和晚期(Advanced Stage,6,000条),使数据集适用于多类别分类、疾病风险评估和分期预测。

临床属性设计具有反映疾病进展的真实统计关系,通过肝功能指标、肿瘤生物标志物水平、症状严重程度和影像学发现的变化体现,支持有意义的特征选择和预测建模。数据集与广泛的机器学习和深度学习算法兼容,包括逻辑回归、决策树、随机森林、支持向量机(SVM)、K近邻(KNN)、XGBoost、LightGBM、CatBoost、人工神经网络(ANN)、TabNet、FT-Transformer、SAINT、TabTransformer、Trompt 以及基于优化的混合框架如灰狼优化(GWO)。重要声明:该数据集专为研究、教育、基准测试和算法开发而创建,不包含真实患者记录、个人身份信息(PII)或机密临床数据,不应用于真实世界的临床诊断或医疗决策。

数据结构与特征设计

数据集包含 50 个结构化临床属性,按功能分为多个类别:

(1) 患者人口统计学(年龄、性别、种族、地理位置等);
(2) 生活方式因素(吸烟、饮酒、饮食习惯、体力活动水平、BMI 等);
(3) 家族史(胆管癌、肝病、其他癌症家族史);
(4) 病史(原发性硬化性胆管炎 PSC、胆管结石、肝吸虫感染、乙肝/丙肝感染、肝硬化、糖尿病、炎症性肠病等危险因素);
(5) 临床症状(黄疸、腹痛、体重减轻、发热、恶心/呕吐、皮肤瘙痒、深色尿液、粪便颜色改变等);
(6) 肝功能检测(总胆红素、直接胆红素、碱性磷酸酶 ALP、谷丙转氨酶 ALT、谷草转氨酶 AST、白蛋白等);
(7) 肿瘤生物标志物(CA 19-9、CEA、AFP 等);
(8) 影像学发现(超声、CT、MRI、MRCP 等影像检查结果,如胆管扩张、肿块、淋巴结肿大等);
(9) 疾病标签(Disease_Class 五类分类)。

数据集设计具有真实的统计关系,反映疾病进展:健康个体具有正常的肝功能指标和低生物标志物水平,低风险个体可能有轻微异常或危险因素(如 PSC、胆管结石),早期胆管癌患者表现为早期症状和中度生物标志物升高,中期患者症状加重和明显的影像学发现,晚期患者有严重症状、高生物标志物水平和广泛转移。数据集包含 40,000 条记录,类别分布设计为适度不平衡但仍可管理(健康 25%、低风险 22.5%、早期 22.5%、中期 15%、晚期 15%),反映真实临床场景中早期病例相对较多但晚期病例也需要关注的情况。

应用价值与研究方向

该数据集为胆管癌研究、临床风险评估、医疗分析和机器学习算法开发提供全面数据支撑,支持多个关键应用方向。早期胆管癌预测:开发机器学习模型从临床特征中早期识别胆管癌患者,支持早期筛查和干预,提高生存率。

疾病分期分类:训练多类别分类模型区分健康、低风险、早期、中期和晚期胆管癌,辅助临床分期和治疗决策。

临床风险评估:构建风险评分模型评估个体患者的胆管癌风险,优先为高危人群安排进一步检查。

医疗分析:分析危险因素(PSC、肝吸虫感染、胆管结石、慢性肝病)与胆管癌发生的关系,识别关键预测因素。可解释人工智能(XAI):应用 SHAP、LIME 等技术解释模型决策,识别对诊断最重要的临床特征,提高临床可信度。

特征工程与选择:研究哪些临床特征、生物标志物和影像学发现对胆管癌诊断最具预测价值。

医学数据挖掘:发现临床数据中的隐藏模式和关联规则。

算法基准测试:评估和比较传统机器学习(逻辑回归、决策树、随机森林、SVM、KNN、XGBoost、LightGBM、CatBoost)、深度学习(ANN)、表格深度学习(TabNet、FT-Transformer、SAINT、TabTransformer、Trompt)和优化算法(灰狼优化 GWO)在胆管癌预测中的性能。

教育目的:用于医学信息学、生物统计学和机器学习课程的教学演示和学生项目。

可重复研究:高质量、标准化的数据集支持可重复的机器学习研究和算法验证。数据集的合成性质确保隐私合规,无 HIPAA/GDPR 限制,可公开共享和使用,为胆管癌这一预后较差的癌症(5年生存率通常<10%)的研究提供宝贵资源。

数据集来源

该数据集(CCRASD-40K)为合成数据集(不含真实患者记录或 PII),包含 40,000 条记录和 50 个临床属性(人口统计、生活方式、病史、症状、肝功能、肿瘤标志物、影像学),目标变量为五类分期(健康 10,000、低风险 9,000、早期 9,000、中期 6,000、晚期 6,000),CSV 格式无缺失值,兼容多种 ML/DL 算法(随机森林、XGBoost、TabNet、Transformer 等),专为胆管癌早期预测、分期分类和算法基准测试而构建,仅供研究使用不得用于临床诊断。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-87
文件大小:1M
原创声明:本数据集为整理作品

← 返回列表