← 技術 CANDARW 2026 原稿

ML-KEMで使われる法q=3329の演算を、既存のCGLAのデータパスへ載せる研究です。専用NTTユニットを追加する代わりに、演算の分解と段間レコードの配置をソフトウェアで構成しています。

手法と評価条件の詳細は、 論文(arXiv公開版) にまとめています。

NTT剰余演算CGLA検証

実装・評価した内容

  • 回転因子を8ビットと4ビットに分割し、部分積を剰余へ落としてから再結合するFP32によるバタフライ演算を構成。
  • 先頭2段を41-PE呼出しへ融合し、残りを47-PE呼出しで処理する7回の呼出しを連結する処理を実装。
  • 各段の出力を次段向けレコードへ直接格納し、ARM側の並べ替えと正規化、DMAを含む処理境界を評価。
  • CPU参照との係数比較、バッチ条件ごとの実測、ASIC投影を原稿に整理。
NTTの演算分解と41/47-PE 割当て(arXiv公開版)。
NTTの演算分解と41/47-PE 割当て(arXiv公開版)。 出典

結果

原稿では4組の実験条件・105回のFPGA実行で817,152出力係数がCPU参照と一致しています。

バッチサイズ64で測定したFPGA上の処理全体の時間は27.5 µs/NTTです。これはASIC実測値ではありません。

バッチ 8でのオフロード深度比較。FPGA実測時間と、PEの動作制御を含むASIC システム全体のエネルギーの投影(arXiv公開版)。
バッチ 8でのオフロード深度比較。FPGA実測時間と、PEの動作制御を含むASIC システム全体のエネルギーの投影(arXiv公開版)。 出典