Technology
研究内容や個人で行っている勉強の活動記録です。
HW/SWの協調実装
アプリケーションにおける演算のマッピング、正しさの検証と性能分析などです。
ML-KEMで用いるNTT演算
CANDARW 2026 原稿q=3329上のNTT演算をCGLAに割り当てる。段間のデータ配置とARM・DMA境界まで含め、CPU参照との一致とFPGA実測を評価。
BitNetの低ビット演算と実行環境への組込み
CANDARW 2026 原稿三値重みとint8形式の活性値を符号付き4ビット整数命令に割り当てる。BitNet C++の一部呼出しをオフロードし、ホスト・データ準備・出力回収の境界を分析。
Mamba系状態空間モデルのカーネル実装と評価
MCSoC 2026 原稿全結合の射影演算、SSD、再帰状態更新をCGLAに割り当て、カーネル単体からトークン実行までの境界とボトルネックを評価。
メモリ多項式によるデジタルプリディストーション(DPD)の実装
APCCAS 2026 原稿メモリ多項式によるDPDの複素数の積和による集約演算をCGLAに割り当てる。実測時間、モデル電力による評価、合成PAモデルのNMSE・ACLRを整理。
CGLA向けLLM実行最適化
静的なチャンク分割で顕在化する転送オーバーヘッドに着目し、量子化条件に応じてチャンクサイズを動的に決める Q-snap を提案した。プリフィルで 1.62 倍の高速化を確認している。
音声認識(ASR)の高効率実装
Whisper を IMAX 上に実装し、独自の FP16 演算カーネルを開発した。省電力推論を実現しながら、CGLA の汎用性を示している。
生成 AI の CGLA 上での実装
Stable Diffusion を IMAX 上に実装し、LLM 以外の生成 AI ワークロードにも適用できることを評価した。エンドツーエンドの性能と電力効率を確認している。
IMAX アーキテクチャの評価と実装
演算ユニットとキャッシュメモリを交互配置した非ノイマン型 CGLA。エッジ向け IMAX3 とサーバ向け IMAX4 の比較評価やアプリケーション実装に取り組んでいる。
エッジAI・画像処理
FPGAを使った認識システムと、実機への応用を見据えた画像処理などまとめています。
FPGA による表情認識システム
DPU ベースの DNN アクセラレータを用いて、FPGA 上でリアルタイム表情認識システムを実装した。マルチスレッド化と低消費電力化を両立している。
DNNベースの小ねぎ分岐部検出
背景や照明条件が複雑な環境に対応するため、YOLOX ベースの検出とインスタンスセグメンテーションを用いた分岐部検出を検討した。自動調製機への実応用を見据えた認識系として整理している。
エッジ検出による小ねぎ分岐部検出
小ねぎ分岐部に現れる斜線に着目し、エッジ検出ベースの軽量アルゴリズムを構成した。Raspberry Pi 3 上で検出率 90.6%、処理時間 455 ms を確認している。
組込みシステム・PoC
個人で実際に動かした回路・ファームウェアの経験などをまとめています。研究成果とは別に、将来のキャリアのために取り組んだPoCの記録です。
24V産業用デジタル入力
LM393、PC817、74HC14からMSPM0の割込み・デバウンスまでをつなぐ入力回路PoC。
RS-485通信
MAX3485とUARTを使った通信、120Ω終端・バイアス、長時間通信試験の経験。
MSPM0の周辺機能制御
GPIO割込み、TimerG、ADC12連続変換、UARTイベントカウント、__WFIを組み合わせたファームウェア。
DRV8835のモータ制御とトラブルシュート
MCUからのモータ駆動、MODE設定、誤配線時の不調と復旧をまとめた事例。
技術ノート
電子回路における基礎実験と調査の記録として整理しています。