三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0评估全流程:从lm-evaluation-harness安装到GSM8K测试

Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0评估全流程:从lm-evaluation-harness安装到GSM8K测试

Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0评估全流程:从lm-evaluation-harness安装到GSM8K测试

【免费下载链接】Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0项目地址: https://ai.gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0

Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0是由AMD基于Microsoft Phi-4-reasoning-plus模型量化优化的CPU推理模型,采用8位权重和8位动态激活量化(W8A8)技术,通过LLM Compressor v0.12.0实现,专为AMD EPYC处理器优化,可在Linux系统上通过vLLM引擎高效运行。

评估准备:环境与工具安装

核心依赖安装

评估前需确保系统已安装以下组件:

  • Python环境:建议3.8+版本
  • 基础依赖包
    pip install torch==2.11.0 zentorch==2.11.0.3 vllm==0.26.0 llmcompressor==0.12.0

lm-evaluation-harness部署

lm-evaluation-harness是EleutherAI开发的基准测试框架,支持多种语言模型评估:

# 克隆官方仓库 git clone https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness # 安装依赖 pip install -e .

模型获取与部署

克隆模型仓库

通过Git获取量化模型文件:

git clone https://gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0 cd Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0

环境变量配置

为确保vLLM引擎性能,需设置OpenMP库加载路径:

# 使用LLVM OpenMP export LD_PRELOAD=$(find /path/to/venv -name "libomp.so" | head -1) # 或Intel OpenMP export LD_PRELOAD=$(find /path/to/venv -name "libiomp5.so" | head -1)

GSM8K评估全流程

评估命令解析

使用lm-evaluation-harness对GSM8K数据集(5-shot)进行测试:

lm_eval \ --model vllm \ --model_args pretrained=amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0,dtype=bfloat16 \ --tasks gsm8k \ --batch_size auto \ --trust_remote_code \ --num_fewshot 5 \ --apply_chat_template \ --log_samples \ --gen_kwargs "max_gen_toks=2048" \ --output_path ./evaluation_results
参数说明:
  • --model vllm:指定使用vLLM推理引擎
  • --num_fewshot 5:采用5样本示例提示
  • --apply_chat_template:应用模型对话模板chat_template.jinja
  • --output_path:结果保存路径

评估结果解读

官方测试显示,该量化模型在GSM8K(5-shot)任务上表现优异:

基准测试BF16原始模型W8A8量化模型性能恢复率
GSM8K (5-shot)0.87040.8893102.17%

关键发现:量化模型准确率(0.8893)超过原始BF16模型,实现102.17%的性能恢复,同时磁盘空间减少46%(从27.3 GiB降至14.6 GiB)。

常见问题解决

依赖版本冲突

若出现ImportError,需严格匹配版本要求:

torch==2.11.0 zentorch==2.11.0.3 vllm==0.26.0 llmcompressor==0.12.0

查看完整依赖清单:requirements配置

推理性能优化

  • CPU核心配置:设置OMP_NUM_THREADS为物理核心数
  • 内存分配:确保系统空闲内存≥32GB
  • 量化参数:参考recipe.yaml中的优化配置

总结与扩展

Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0通过W8A8量化实现了高效CPU推理,在保持推理质量的同时显著降低资源占用。评估流程可扩展至其他基准测试(如MMLU、TruthfulQA),只需修改--tasks参数即可。完整评估脚本与配置文件可在项目根目录获取,包括:

  • 量化配置:recipe.yaml
  • 模型参数:config.json
  • 生成配置:generation_config.json

建议定期查看SECURITY.md获取安全更新,遵循CODE_OF_CONDUCT.md进行模型使用与二次开发。

【免费下载链接】Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0项目地址: https://ai.gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表