三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

疾病症状和患者概况数据集

疾病症状和患者概况数据集

摘要:疾病症状和患者概况数据集(CSV)包含 10 列特征涵盖 100 多种疾病,MIT 许可证,可用性 10.00/10,专为临床分析、疾病诊断预测和医疗 AI 模型训练而构建。

数据集简介

数据集概述

疾病症状和患者概况数据集是一个全面的医学数据集,揭示了100多种疾病中患者与疾病之间错综复杂的关系。该数据集汇集了丰富的信息,揭示症状、人口统计特征和健康指标之间的复杂联系,涵盖发热、咳嗽、疲劳、呼吸困难等常见症状,以及年龄、性别、血压、胆固醇水平等患者特征。数据集适用于医学研究人员、医疗保健专业人员和数据科学爱好者,用于探索隐藏模式、发现独特症状特征并开启医学探索之旅。数据集以 CSV 格式提供,预期更新频率为季度更新。

数据结构与关键特征

数据集包含 10 列关键特征,涵盖疾病信息、症状、人口统计学和健康指标:

(1) Disease(疾病):疾病或病症的名称,涵盖 100 多种疾病;

(2) Fever(发热):患者是否发热(是/否),二元变量;

(3) Cough(咳嗽):患者是否咳嗽(是/否),二元变量;

(4) Fatigue(疲劳):患者是否感到疲劳(是/否),二元变量;

(5) Difficulty Breathing(呼吸困难):患者是否呼吸困难(是/否),二元变量;

(6) Age(年龄):患者的年龄(以年为单位),连续变量;

(7) Gender(性别):患者的性别(男/女),分类变量;

(8) Blood Pressure(血压):患者的血压水平(正常/偏高),分类变量;

(9) Cholesterol Level(胆固醇水平):患者的胆固醇水平(正常/偏高),分类变量;

(10) Outcome Variable(结果变量):指示特定疾病诊断或评估结果的结果变量(阳性/阴性),目标变量。

数据集设计用于探索症状、年龄、性别、血压、胆固醇等变量与疾病诊断之间的关系,支持多种机器学习任务。

应用价值与研究方向

该数据集为医学研究、临床诊断和医疗 AI 提供核心数据支撑。核心应用:

(1) 疾病诊断预测:开发机器学习模型(逻辑回归、随机森林、XGBoost、神经网络)基于症状和患者特征预测疾病诊断;

(2) 症状模式分析:发现不同疾病的独特症状特征和组合模式;

(3) 医疗 AI 模型训练:医疗科技公司可用于训练和验证诊断工具或 AI 算法;

(4) 风险因素识别:分析年龄、性别、血压、胆固醇与疾病风险的关系;

(5) 多疾病分类:训练模型区分 100 多种疾病;

(6) 临床决策支持:为医生提供基于症状的诊断辅助工具;

(7) 流行病学研究:分析疾病在不同人群中的分布和患病率;

(8) 探索性数据分析:探索隐藏模式和关联规则。

为改善疾病诊断和患者健康管理提供研究资源。

数据集来源

数据集(CSV)包含 10 列特征(疾病、发热、咳嗽、疲劳、呼吸困难、年龄、性别、血压、胆固醇、结果变量),涵盖 100 多种疾病,MIT 许可证,可用性 10.00/10,季度更新,专为临床分析、疾病诊断预测和医疗 AI 模型训练而设计。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-98
文件大小:3K
原创声明:本数据集为整理作品

← 返回列表