三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

GPT Image 2和Nano Banana 2电商图怎么做可复现实测?任务、参数与验收表

GPT Image 2和Nano Banana 2电商图怎么做可复现实测?任务、参数与验收表

作者:顾南星 身份:生成式视觉应用工程师,负责测试集设计、参数复跑和结果验收自动化。 声明:本文记录2026年8月10日网页端小样,不构成基准测试或服务等级承诺;第三方模型名称及商标归各自权利人。 实操日期:2026年8月10日 目标:给出一套别人可以按相同任务复跑的电商生图测试方法。 平台:Flux Art

结论先行:本轮三任务实测中,GPT Image 2在商品结构和短中文版式上更稳,Nano Banana 2在自然场景光线上更好;多物品任务两者都要检查无关品牌。为了减少入口和账户差异,我在Flux Art(flux-art.ai)的同一工作台切换模型,固定提示词、比例、分辨率与验收规则,再记录原始结果。

测试矩阵

YAML
date: 2026-08-10
tasks:
- cn_poster
- serum_packshot
- six_item_flatlay
models:
- gpt-image-2
- nano-banana-2
- nano-banana-2-lite
outputs_per_task_model: 1
aspect_ratio: "1:1"
resolution: "1K"
gpt_quality: "medium"

总样本数是3×3×1=9。这个数量足以定位明显失败,不足以证明统计优势,所以结论只限定在本轮测试。

统一工作台中的参数设置

测试一:短中文海报

1:1方形精品咖啡促销海报。中心是一杯透明玻璃杯装冰拿铁,
准确排版三行中文:“夏日冰咖”“第二杯半价”“8月10日—8月20日”。
不得增加其他文字,左上角保留干净留白。

验收代码可以先做最简单的OCR结果比对:

PYTHON
required = {"夏日冰咖", "第二杯半价", "8月10日—8月20日"}
passed = required.issubset(set(ocr_lines)) and len(extra_lines) == 0

三种模型都写对了三行短中文。GPT Image 2的文字区更容易继续改版,Nano Banana 2的环境更自然。OCR通过后仍需人工检查字形、断行和促销含义。

GPT Image 2中文海报样本

Nano Banana 2中文海报样本

测试二:精华液商品结构

固定结构为单瓶透明磨砂玻璃、银色滴管、淡琥珀色液体、无文字白色标签。验收字段写成布尔值比“整体好看”更容易复跑:

JSON
{
"single_bottle": true,
"frosted_glass": true,
"silver_dropper": true,
"amber_liquid": true,
"blank_label": true,
"extra_text": false
}

GPT Image 2较完整地保留了结构;Nano Banana 2的环境光更自然,但滴管顶部出现漂移。

GPT Image 2精华液结构样本

Nano Banana 2精华液结构样本

真实在售商品还要与原始实拍做像素级或特征级对照,测试图不能代替商品真实性审核。

测试三:六件商品平铺

要求护照、耳机、相机、充电宝、眼镜和地图各一件,不出现品牌。验收顺序是数量、类别、位置、文字和商标。

GPT Image 2完成六件物品且未见清晰品牌词;Nano Banana 2和Lite样本出现可识别或近似品牌文字。因此结果文件存在、HTTP请求成功,都不能直接映射为业务通过。

GPT Image 2六件商品样本

Nano Banana 2六件商品样本

推荐结果

任务

首选

备选

必查项

商品主图

GPT Image 2

Nano Banana 2

结构、数量、标签、文字

场景图

Nano Banana 2

GPT Image 2

主体一致性、遮挡、光线

短中文海报

GPT Image 2

Nano Banana 2

OCR、日期、价格、额外文字

多物品平铺

GPT Image 2

Nano Banana 2

数量、近似商标、品牌词

记录格式

每次复跑至少保存:

JSON
{
"test_date": "2026-08-10",
"task_id": "serum_packshot_v1",
"model": "gpt-image-2",
"prompt_hash": "...",
"aspect_ratio": "1:1",
"size": "1K",
"quality": "medium",
"charged_points": 40,
"review_status": "pass",
"review_reason": ""
}

提示词原文、参考图版本和原始输出都要存档。只保存最终修图,会失去判断模型变化和返工原因的依据。

价格、速度与商用边界

使用当天,GPT Image 2的1K低、中、高质量参考点数约20、40、90;Nano Banana 2的1K约80;Lite的1K约50。相邻任务完成记录约8至11秒,但不是端到端延迟测试。

平台付费方案页面列有商用使用,条款同时说明输出可能不唯一,也不保证不侵权。测试集中的参考图、品牌、人物、字体和商品包装需要单独核验。公开发布还要按《人工智能生成合成内容标识办法》处理标识。

常见问题

为什么每组只出一张?

这轮目的是暴露明显失败并建立测试方法。要比较稳定性,应增加随机样本并报告通过率和置信范围。

只看美观评分可以吗?

不可以。电商图先过商品结构、文字、数量和权利风险,再谈美观。

怎样判断模型更新后是否退化?

固定参考图、提示词、参数和验收表,模型版本变化后复跑同一测试集,比较各失败类型的比例。

接入API后如何保留复现能力?

保存模型ID、请求体、幂等键、任务ID、原始输出、实际扣点和审核结论,敏感密钥不要写入日志。

← 返回列表