Real-ESRGAN超分辨率实战:从环境搭建到4倍高清还原

📅 2026/7/21 18:11:41 👁️ 阅读次数 📝 编程学习
Real-ESRGAN超分辨率实战:从环境搭建到4倍高清还原

Real-ESRGAN 超分辨率实战:从环境搭建到 4 倍高清还原

一、引言

在实际项目中,我们经常遇到低分辨率图像需要放大的场景:监控视频取证、老照片修复、医学影像增强、卫星图像处理等。传统的双三次插值(Bicubic)放大后图像模糊、细节丢失严重。Real-ESRGAN是腾讯 ARC 实验室开源的盲超分辨率模型,能够将低分辨率图像放大 4 倍甚至更多,同时恢复逼真的纹理细节。

本文将带你从零开始搭建 Real-ESRGAN 环境,完成第一张图像的超分辨率还原。

二、Real-ESRGAN 技术原理速览

Real-ESRGAN 基于 ESRGAN(Enhanced Super-Resolution GAN)改进,核心创新在于:

  1. 高阶退化建模(High-order Degradation Model):传统超分模型假设输入是理想的下采样图像,但真实世界的低分辨率图像包含模糊、噪声、JPEG 压缩伪影等多种退化。Real-ESRGAN 使用二阶退化管线模拟真实退化过程:
HR → [Blur + Downsample + Noise + JPEG] → [Blur + Downsample + Noise + JPEG] → LR
  1. RRDBNet(Residual-in-Residual Dense Block Network):生成器采用 RRDB 结构,在残差块内部使用密集连接,最大化信息流动:

    • 每个 RRDB 包含 3 个密集连接的卷积层
    • 残差缩放因子 β=0.2,稳定训练
    • 总共 23 个 RRDB 块,约 1600 万参数
  2. U-Net 判别器 + 频谱归一化:增强判别器对全局和局部纹理的感知能力,避免伪影。

  3. 纯合成数据训练:完全使用合成的退化图像训练,但通过多样化的退化管线,在真实场景中表现出色。

三、环境搭建

3.1 创建虚拟环境

conda create-nrealesrganpython=3.9-yconda activate realesrgan

3.2 安装依赖

# 克隆仓库gitclone https://github.com/xinntao/Real-ESRGAN.gitcdReal-ESRGAN# 安装 PyTorch(根据 CUDA 版本选择)pipinstalltorch==2.0.1torchvision==0.15.2 --index-url https://download.pytorch.org/whl/cu118# 安装其他依赖pipinstallbasicsr pipinstallfacexlib pipinstallgfpgan pipinstallopencv-python pipinstallnumpy

3.3 下载预训练模型

# 下载通用模型(推荐)wgethttps://github.com/xinntao/Real-ESRGAN/releases/download/v0.1.0/RealESRGAN_x4plus.pth-Pweights/# 下载动漫专用模型(可选)wgethttps://github.com/xinntao/Real-ESRGAN/releases/download/v0.2.2.4/RealESRGAN_x4plus_anime_6B.pth-Pweights/

四、图像超分辨率实战

4.1 命令行快速使用

# 单张图像 4 倍放大python inference_realesrgan.py\-nRealESRGAN_x4plus\-iinput.jpg\-ooutput.jpg\--outscale4\--face_enhance# 批量处理python inference_realesrgan.py\-nRealESRGAN_x4plus\-i./input_folder/\-o./output_folder/\--outscale4\--suffix_4x

4.2 Python API 调用

importcv2importtorchimportnumpyasnpfrombasicsr.archs.rrdbnet_archimportRRDBNetfromrealesrganimportRealESRGANerdefsuper_resolve_image(input_path,output_path,scale=4):\"\"\" 使用 Real-ESRGAN 进行图像超分辨率 \"\"\"# 1. 加载模型model=RRDBNet(num_in_ch=3,num_out_ch=3,num_feat=64,num_block=23,num_grow_ch=32,scale=scale)# 2. 创建上采样器upsampler=RealESRGANer(scale=scale,model_path='weights/RealESRGAN_x4plus.pth',model=model,tile=400,# 分块处理,避免 OOMtile_pad=10,pre_pad=0,half=False# FP16 推理(需 GPU 支持))# 3. 读取图像img=cv2.imread(input_path,cv2.IMREAD_COLOR)h,w=img.shape[:2]print(f"Input:{w}x{h}")# 4. 超分辨率处理output,_=upsampler.enhance(img,outscale=scale)h_new,w_new=output.shape[:2]print(f"Output:{w_new}x{h_new}")# 5. 保存结果cv2.imwrite(output_path,output)print(f"Saved to{output_path}")returnoutput# 使用示例if__name__=='__main__':super_resolve_image('input.jpg','output_4x.png',scale=4)

4.3 关键参数说明

参数说明推荐值
tile分块大小,显存不足时减小400(8GB显存)
tile_pad块边缘填充像素10
pre_pad预处理填充0
halfFP16 推理,降低显存占用True(RTX 20xx+)
outscale输出放大倍数4(默认)
alpha_upsampler二次上采样方法‘realesrgan’

4.4 人脸增强

Real-ESRGAN 内置了 GFPGAN 人脸增强:

upsampler=RealESRGANer(scale=4,model_path='weights/RealESRGAN_x4plus.pth',model=model,tile=400,face_enhance=True# 启用人脸增强)

五、效果对比与评估指标

5.1 常用评估指标

fromskimage.metricsimportpeak_signal_noise_ratioaspsnrfromskimage.metricsimportstructural_similarityasssimimportlpips# PSNR & SSIMpsnr_value=psnr(gt_img,sr_img)ssim_value=ssim(gt_img,sr_img,channel_axis=2)# LPIPS(感知相似度)loss_fn=lpips.LPIPS(net='alex')lpips_value=loss_fn(gt_tensor,sr_tensor).item()

5.2 典型效果数据

方法PSNR↑SSIM↑LPIPS↓推理时间(512×512)
Bicubic26.880.8250.340<1ms
ESRGAN27.510.8350.195120ms
Real-ESRGAN28.120.8420.178150ms
Real-ESRGAN+28.350.8480.165180ms

六、常见问题与解决方案

6.1 OOM(显存不足)

  • 减小tile参数(如 200)
  • 启用half=True
  • 降低输入图像分辨率

6.2 输出图像偏色

  • 检查输入图像是否为 RGB 格式
  • cv2.imread默认读取为 BGR,需转换:cv2.cvtColor(img, cv2.COLOR_BGR2RGB)

6.3 纹理过度锐化

  • 使用RealESRGAN_x4plus(通用模型)而非anime模型
  • 调低outscale

七、总结

Real-ESRGAN 是目前最实用的开源超分辨率方案之一,在盲超分场景下的效果远超传统插值方法。本文覆盖了从环境搭建、模型推理到参数调优的完整流程。下一篇我们将深入 RRDBNet 架构,解析其设计精髓。


参考资源:

  • 项目地址:https://github.com/xinntao/Real-ESRGAN
  • 论文:Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data
  • 在线 Demo:https://huggingface.co/spaces/akhaliq/Real-ESRGAN