本 R 脚本依托tidyverse工具包,分类统计与可视化出图,仅提取文件首列转录因子家族分类信息完成频次统计,最终输出标准化柱状统计图,直观展示不同类别对应的基因数量分布特征。
# 加载所需包 library(tidyverse) #文件路径 setwd("F:/00.玉米全基因组范围内鉴定转录因子/TF") getwd() # 读取数据 df <- read.delim( file = "zea.TF.GeneID.txt",header = TRUE, sep = "\t",fileEncoding = "UTF-8" ) # 提取数据第一列 col1 <- df[, 1] #分类频数统计 freq_result <- table(col1) cat("第一列分类计数统计结\n") print(freq_result) # 整理为ggplot绘图数据框 plot_data <- as.data.frame(freq_result) colnames(plot_data) <- c("Category", "Count") #、绘制频数柱状图 ggplot(plot_data, aes(x = Category, y = Count, fill = Category)) + geom_col(show.legend = FALSE, width = 0.7) + geom_text(aes(label = Count), vjust = -0.35, size = 3.6) + labs( title = "文本文件第一列各类别数量统计", x = "类别", y = "样本数量" ) + theme_bw() + theme( plot.title = element_text(hjust = 0.5, size = 14), axis.text.x = element_text(angle = 45, hjust = 1), # X轴文字倾斜防重叠 axis.title.x = element_text(size = 12), axis.title.y = element_text(size = 12) )