基于R语言实现的beta二项回归模型【理解与实现】

本实验,创建一组使用二项分布模拟的数据(不带额外的随机性),和另一组使用Beta二项分布模拟的数据(引入了随机成功概率 p,从而增加了数据的离散性。

现在假设我们站在上帝视角,有两组不知道分布的数据。

一、如何理解:“观察到的方差大于二项分布预期的方差”

1.生成二项分布数据(不带额外的随机性)

set.seed(123)  # 确保结果可重现
n <- 100  # 样本大小
p_fixed <- 0.5  # 固定的成功概率
trials <- 100  # 每次试验的总次数

# 生成数据
binomial_data <- rbinom(n, trials, p_fixed)

2. 生成Beta二项分布数据(引入随机性的成功概率)

# Beta分布参数
alpha <- 2
beta <- 5

# 生成成功概率
p_random <- rbeta(n, alpha, beta)

# 使用Beta生成的成功概率生成数据
beta_binomial_data <- rbinom(n, trials, p_random)

3. 计算并比较两组数据的方差

# 计算实际方差
var_binomial <- var(binomial_data)
var_beta_binomial <- var(beta_binomial_data)

# 计算二项分布预期的方差
expected_var_binomial <- trials * p_fixed * (1 - p_fixed)

# 打印结果
print(paste("方差 - 二项分布数据:", var_binomial))
print(paste("方差 - Beta二项分布数据:", var_beta_binomial))
print(paste("预期方差 - 标准二项分布:", expected_var_binomial))

你会发现Beta二项分布数据的方差通常会大于二项分布数据的方差,因为Beta二项分布引入的成功概率的随机性增加了数据的离散性。同时,你也会发现这个方差大于标准二项分布预期的方差,这正是我们需要使用Beta二项模型的原因。

4.可视化

# 加载必要的库
library(ggplot2)

# 创建数据框
df <- data.frame(
  Data_Type = c(rep("Binomial", length(binomial_data)), rep("Beta-Binomial", length(beta_binomial_data))),
  Count = c(binomial_data, beta_binomial_data)
)

# 绘制直方图
ggplot(df, aes(x = Count, fill = Data_Type)) +
  geom_histogram(position = "identity", alpha = 0.7, bins = 20) +
  labs(title = "Histogram of Binomial vs Beta-Binomial Data",
       x = "Count", y = "Frequency") +
  theme_minimal()

在这里插入图片描述
从直方图可以看出,Beta-Binomial 数据的分布更加广泛,呈现出更大的离散性,相比之下,Binomial 数据更加集中。这符合我们的预期,因为Beta-Binomial 数据引入了成功概率的随机性,增加了数据的变异性。

二、使用Beta二项分布模型主要涉及数据的拟合与分析过程

解释 VAGM

1.完整代码

# 加载必要的库
if (!require("VGAM")) install.packages("VGAM", dependencies = TRUE)
library(VGAM)

# 生成模拟数据
set.seed(123)  # 设置随机数种子以确保结果可重现
n <- 100  # 样本大小
alpha <- 2  # Beta分布参数α
beta <- 5   # Beta分布参数β
trials <- sample(10:100, n, replace = TRUE)  # 每个观察的试验次数
p <- rbeta(n, alpha, beta)  # 从Beta分布生成成功概率
success <- rbinom(n, trials, p)  # 生成成功次数

data <- data.frame(success = success, trials = trials, predictor1 = rnorm(n), predictor2 = runif(n))

# 拟合Beta二项回归模型
model <- vglm(cbind(success, trials - success) ~ predictor1 + predictor2, 
              family = betabinomial(link = "logit"), 
              data = data)

# 查看模型摘要
summary(model)

# 模型诊断
par(mfrow = c(2, 2))
plot(model)

# 模型预测
new_data <- data.frame(predictor1 = c(0, 1), predictor2 = c(0.5, 0.5))
predictions <- predict(model, newdata = new_data, type = "response")
print(predictions)

导出结果解释

1.数据的形式

在这里插入图片描述
响应变量:成功次数和失败次数(Trials-success),
预测变量:predictor1 & predictor2

2.model 拟合结果

在这里插入图片描述
注意:
当我们拟合Beta二项分布时,模型实际上是在估计两个参数:成功概率p 的平均值和分布的离散程度。由于Beta分布是由两个参数控制的,这两个参数通常用不同的链接函数进行转换。
在这种情况下,每个链接函数可能有自己的截距,因此输出中显示了两个截距。

(Intercept):1 — 通常代表与成功概率 p 相关的截距项。
(Intercept):2 — 代表与Beta分布的离散参数相关的截距项。
忽略 参数的显著性

3.模型诊断

在这里插入图片描述
模型诊断图是统计建模中的一个重要组成部分,它们可以帮助我们识别模型中的问题,比如不符合假设的数据、异常值或模型拟合不良。
总体上:

从这些诊断图来看,模型似乎没有表现出明显的拟合问题。残差分布比较均匀,没有明显的模式,也没有迹象显示数据点有不适当的杠杆效应。
具体地:

  • Pearson残差 vs. 线性预测器1:
    这个图显示了每个观测值的Pearson残差与第一个预测变量的线性预测值的关系。理想情况下,这些点应该随机分布,没有明显的模式。从图中看,残差似乎随着预测值的增加而稍微减小,但没有明显的趋势,。然而,这里没有强烈的模式或明显的异常值。

  • Pearson残差 vs. Jittered线性预测器2:
    “Jittered”意味着在横轴的值上添加了一点随机噪声,以避免重叠点。这个图表应该类似于第一个图表,展示残差和第二个预测变量的关系。残差似乎在预测器2的中间范围内聚集得更紧密,这可能表明在这个范围内模型预测更准确。

  • Pearson残差 vs. hat值(Linear Predictor 1):
    帽子值(也称为杠杆值)度量了每个观测值对其自身预测值的影响程度。较高的hat值可能表明一个观测值具有较高的杠杆作用,可能是一个影响模型的异常值。图中hat值较高的点不多,意味着没有单个观测值对模型有过度影响。

  • Pearson残差 vs. hat值(Linear Predictor 2):
    这个图展示的是第二个预测变量的值。同样,我们希望没有观测值有过大的hat值。大多数观测值似乎有低到中等的hat值,没有迹象表明有单个观测对模型有过度影响。

模型预测

在这里插入图片描述

# 2.代码解释

解释代码
生成模拟数据:使用Beta分布参数 α=2 和 β=5 来模拟真实的成功概率 p。
为每个观察生成一个试验次数,并基于模拟的 p 生成成功次数。
拟合模型:
使用vglm函数从VGAM包拟合Beta二项模型,其中响应变量是成功和失败的次数,解释变量是predictor1predictor2
查看和解释模型摘要:
调用summary()函数来获取模型的详细输出,包括估计的参数和它们的统计显著性。
模型诊断:

使用plot()函数生成模型的诊断图,这有助于检查任何潜在的问题,如拟合不良或异常值。
模型预测:

对新的观察数据(在new_data中定义)进行预测,以展示模型如何应用于实际数据

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mfbz.cn/a/551876.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

网工交换基础——MUX VLAN

前言&#xff1a; MUX VLAN&#xff08;Multiplex VLAN&#xff0c;多复用VLAN&#xff09;提供了一种通过VLAN进行网络资源控制的机制。例如&#xff0c;在企业网络中&#xff0c;企业员工和企业客户可以访问企业的服务器。对于企业来说&#xff0c;希望企业内部员工之…

谷粒商城part3——快速开发篇

这里是过来人的学习建议&#xff1a; 1、如有条件电脑内存至少16G起步&#xff0c;条件进一步加个屏幕&#xff0c;条件更进一步租一台至少4G内存的X86架构云服务器&#xff0c;所有部署的东西全扔云服务器上 2、P16&#xff0c;P17没法搭起来的建议照着rerenfast的github上的教…

Python革命:如何利用AI数据分析引领人工智能的未来

在人工智能迅速发展的今天&#xff0c;Python语言已经成为了推动AI领域发展的一大利器。作为一种高级编程语言&#xff0c;Python以其简洁的语法和强大的功能&#xff0c;为AI数据分析提供了强有力的支持&#xff0c;帮助开启了人工智能的新时代。 Python的核心优势 Python的最…

FreeRTOS学习 -- 中断配置

一、什么是中断 中断时微控制器一个很常见的特性&#xff0c;中断是由硬件产生&#xff0c;当中断产生以后CPU就会中断当前的流程而去处理中断服务&#xff0c;Cortex-M内核的MCU提供了一个用于中断管理的嵌套向量中断控制器&#xff08;NVIC&#xff09;。 二、中断优先级分…

区块链安全应用----压力测试

通过Caliper进行压力测试程序 1.环境配置 第一步. 配置基本环境 部署Caliper的计算机需要有外网权限&#xff1b;操作系统版本需要满足以下要求&#xff1a;Ubuntu > 16.04、CentOS > 7或MacOS > 10.14&#xff1b;部署Caliper的计算机需要安装有以下软件&#xff…

作业4.17

1.总结串口的发送和接收功能使用到的函数 发送&#xff1a; HAL_StatusTypeDef HAL_UART_Transmit( UART_HandleTypeDef *huart, const uint8_t *pData, uint16_t Size, uint32_t Timeout ) 接受&#xff1a; HAL_StatusTypeDef HAL_UART_Receive_IT( UART_HandleTypeDef *…

刀具表面上的微结构

刀具表面微结构通常指在刀具表面对特定功能设计的微观纹理&#xff0c;这些纹理可以是沟槽、凹坑、凸起或任何其他形式的微观图案。这些微结构的设计和应用是为了改善刀具的切削性能&#xff0c;减少切削力和切削温度&#xff0c;提高切削效率和精度&#xff0c;同时降低切削液…

Sa-Token使用经验

官方文档;Sa-Token Sa-Token 介绍 Sa-Token 是一个轻量级 Java 权限认证框架&#xff0c;主要解决&#xff1a;登录认证、权限认证、单点登录、OAuth2.0、分布式Session会话、微服务网关鉴权 等一系列权限相关问题。 Sa-Token 旨在以简单、优雅的方式完成系统的权限认证部分…

第十六篇:springboot案例

文章目录 一、准备工作1.1 需求说明1.2 环境搭建1.3 开发规范1.4 思路 二、部门管理2.1 查询部门2.2 删除部门2.3 新增部门2.4 修改部门2.5 RequestMapping 三、员工管理3.1 分页查询3.2 删除员工3.3 新增员工3.3.1 新增员工3.3.2 文件上传 3.4 修改员工3.4.1 页面回显3.4.2 修…

C++ stl容器list的底层模拟实现

目录 前言&#xff1a; 1.创建节点 2.普通迭代器的封装 3.反向迭代器的封装 为什么要对正向迭代器进行封装&#xff1f; 4.const迭代器 5.构造函数 6.拷贝构造 7.赋值重载 8.insert 9.erase 10.析构 11.头插头删&#xff0c;尾插尾删 12.完整代码简单测试 总结&…

刀具刃口钝化

​刀具刃口钝化是指在刀具制作过程中&#xff0c;通过一系列的加工步骤使刀具刃口表面变得光滑、平整&#xff0c;去除因磨削加工造成的微观缺口&#xff0c;以提高刀具的切削性能和寿命。这一过程对于保障刀具的稳定性和精度至关重要&#xff0c;尤其是在高速切削和高精度加工…

Leetcode刷题之合并两个有序数组

Leetcode刷题之合并两个有序数组 一、题目描述二、题目解析 一、题目描述 给你两个按 非递减顺序 排列的整数数组 nums1 和 nums2&#xff0c;另有两个整数 m 和 n &#xff0c;分别表示 nums1 和 nums2 中的元素数目。 请你 合并 nums2 到 nums1 中&#xff0c;使合并后的数…

一夜爆红的4款国产软件,却一度被大众误以为是外国人开发

在现今高度信息化的时代&#xff0c;计算机已经深深地渗透到了我们生活的每一个角落。 从日常的办公学习到娱乐休闲&#xff0c;几乎都离不开计算机技术的支持。而在这背后&#xff0c;软件作为计算机的灵魂&#xff0c;其发展历史可谓波澜壮阔。 中国软件产业经过多年的积累和…

【UE 材质】一些使用外部数据的节点的简单介绍

目录 一、ActorPosition 二、绝对世界位置 三、“CameraVector”与“ReflectionVector” 四、PixelDepth 一、ActorPosition 介绍 用于获取Actor在世界场景中的位置信息 应用举例 我们可以通过“ActorPosition”“Mask&#xff08;B&#xff09;”来获取Actor在Z轴上的位…

Vue项目管理器创建项目

黑马程序员JavaWeb开发教程 文章目录 1、创建新项目2、详情3、预设4、功能5、配置6、是否保存为预设模板7、正在创建项目8、创建完成 1、创建新项目 2、详情 3、预设 选择手动&#xff0c;点击下一步 4、功能 只需要额外选择一项–Router 即可&#xff0c;其余的保持默认&a…

Android Studio修改项目包名

1.第一步&#xff0c;项目结构是这样的&#xff0c;3个包名合在了一起&#xff0c;我们需要把每个包名单独展示出来 2.我们点击这个 取消选中后的包名结构是这样的&#xff0c;可以看到&#xff0c;包名的每个文件夹已经展示分开了&#xff0c;现在我们可以单独对每个包名文件夹…

【重磅】2024大模型应用研究与案例报告合集(共18份)

文末领取福利&#xff0c;扫描进群获取&#xff01;&#xff01;&#xff01; 2024工业大模型应用报告.pdf 2024大语言模型能力测评报告.pdf 2024大模型落地应用案例集.pdf 2023中文大模型基准测评年度报告.pdf 2023人工智能大模型体验报告3.0.pdf 2023人工智能大模型体验报告…

Python文件操作大全

1 文件操作 1.1 文件打开与关闭 1.1.1 打开文件 在Python中&#xff0c;你可以使用 open() 函数来打开文件。以下是一个简单的例子&#xff1a; # 打开文件&#xff08;默认为只读模式&#xff09; file_path example.txt with open(file_path, r) as file:# 执行文件操作…

网络编程(现在不重要)

目录 网络编程三要素与InetAddress类的使用 软件架构 面临的主要问题 网络编程三要素&#xff08;对应三个问题&#xff09; InetAddress的使用 TCP与UDP协议剖析与TCP编程案例&#xff08;了解&#xff09; TCP协议 UDP协议 例子 UDP、URL网络编程 URL&#xff1a;&…

机器学习引领金融革命:重塑金融服务领域新格局,开启智能化新篇章

&#x1f9d1; 作者简介&#xff1a;阿里巴巴嵌入式技术专家&#xff0c;深耕嵌入式人工智能领域&#xff0c;具备多年的嵌入式硬件产品研发管理经验。 &#x1f4d2; 博客介绍&#xff1a;分享嵌入式开发领域的相关知识、经验、思考和感悟,欢迎关注。提供嵌入式方向的学习指导…
最新文章