Tongyi-MAI/Z-Image-Turbo で描いてみた記録
要旨
- 規模:パラメータは合計約102.6億個。重みのファイルは約32.8GB。
- 作り:ZImagePipeline。部品は vae(AutoencoderKL)、text_encoder(Qwen3Model)、transformer(ZImageTransformer2DModel)。
- 描き方:1024×1024 ピクセル、段数 9、ガイダンス 0.0。値はモデルの説明(README)にある diffusers の使用例から読み取ったもので、書かれていない項目はパイプラインの既定値とした。
- 速さ:RTX 3090 1 枚・bf16 で、1 枚あたり中央値 9.5 秒(最初の 1 枚は 10.2 秒)。VRAM の最大使用量は 21.7GB。全部を GPU に載せて描いた。
- ライセンス:apache-2.0。生成した絵を載せることが認められているライセンスのモデルだけを記録している。
一行要約:ZImagePipeline、約102.6億パラメータ、1024×1024、9 段、1 枚 9.5 秒(RTX 3090)
描かせた絵
6 つの固定のプロンプトを、乱数の種 1 と 2 で描かせた(左が種 1、右が種 2)。手直しや選別はしていない。
1. 写真の人物
A photograph of an elderly fisherman mending a net on a wooden pier at dawn, soft natural light, 50mm lens
(夜明けの木の桟橋で網を繕う年配の漁師の写真。やわらかい自然光、50mm レンズ)

描画時間:10.2 秒 / 9.4 秒
2. 風景
A moss-covered wooden bench in a quiet forest clearing, sunlight filtering through the trees
(静かな森の空き地にある、苔むした木のベンチ。木々のあいだから差し込む日の光)

描画時間:9.3 秒 / 9.4 秒
3. 文字
A small wooden shop sign that reads "MOSSBENCH" in painted letters, hanging above a door
(扉の上に下がった小さな木の看板。ペンキの文字で「MOSSBENCH」と書いてある)

描画時間:9.4 秒 / 9.4 秒
4. 手
Close-up of two hands holding a cup of green tea
(緑茶の入った湯のみを持つ両手のアップ)

描画時間:9.5 秒 / 9.5 秒
5. 数と配置
Three red apples and two blue cups on a white table, top view
(白いテーブルの上の、赤いりんご 3 個と青いコップ 2 個。真上から)

描画時間:9.5 秒 / 9.5 秒
6. イラスト
A flat vector illustration of a cat reading a book under a desk lamp
(机のライトの下で本を読む猫の、フラットなベクターイラスト)

描画時間:9.5 秒 / 9.5 秒
部品
| 部品 | クラス | パラメータ数 | 型 |
|---|---|---|---|
| vae | AutoencoderKL | 83,819,683 | bfloat16 |
| text_encoder | Qwen3Model | 4,022,468,096 | bfloat16 |
| tokenizer | Qwen2Tokenizer | — | — |
| scheduler | FlowMatchEulerDiscreteScheduler | — | — |
| transformer | ZImageTransformer2DModel | 6,154,908,736 | bfloat16 |
測定条件
- imgscope 0.1.1、Python 3.14.4、torch 2.13.0+cu130, diffusers 0.39.0, transformers 5.14.1, huggingface_hub 1.33.0, accelerate 1.15.0, safetensors 0.8.0
- GPU:NVIDIA GeForce RTX 3090、bf16、TF32 無効。乱数は
torch.Generator('cpu').manual_seed(seed) - 置き方:全部を GPU に載せる。読み込み 296 秒
- 使った設定:num_inference_steps=9(README), guidance_scale=0.0(README), height=1024(README), width=1024(README), max_sequence_length=512(既定値)
- パイプラインの既定値(参考):{'num_inference_steps': 50, 'guidance_scale': 5.0, 'height': None, 'width': None, 'max_sequence_length': 512}
- 時間は 1 枚ごとに GPU の処理の完了まで測った。VRAM は torch が確保した量の最大値
- モデル:Tongyi-MAI/Z-Image-Turbo(リビジョン
f332072aa78b)
コメント
…