← 技術

Stable DiffusionのCGLA実装

MCSoC 2025

stable-diffusion.cppの主要演算カーネルをIMAX3へ実装した研究です。LLM向けに開発した量子化カーネルを画像生成へ適用し、CPUに残る処理とオフロードできる処理を評価しました。

Stable DiffusionGGML量子化カーネルの対応範囲

実装・評価した内容

  • GGMLを介してQ8_0・Q3_Kの内積演算カーネルを画像生成処理へ適用。
  • U-Net等で使う演算を調べ、カーネルの対応範囲とCPU側での代替実行を分析。
  • SD-Turboの画像生成をFPGAプロトタイプで実行し、ASIC性能を投影。
既存サイトに掲載しているMCSoC研究紹介図。
既存サイトに掲載しているMCSoC研究紹介図。

結果

保存原稿では量子化演算の対応範囲をQ3_Kで10.3%、Q8_0で16.3%と報告しています。

FP16/FP32のCPU側での代替実行が残るため、オフロードしたカーネルの性能と画像生成全体の時間を分けて整理しています。