GPU・製造・産業|Week 12

製品・産業と総合課題

これまでの仕組みを製品の中へ置き直し、用途に合ったCPU/GPUの見方を作ります。

最後は『どの数字が大きい?』より『何をしたい製品?』から考えてみよう。
回路図タブレットを持ち、学習者を案内する半導体設計者の先生

この週でできるようになること

  • 身近な製品の中で複数種類の半導体が協力する様子を説明できる。
  • IDM、ファブレス、ファウンドリ、OSAT、EDA、装置・材料企業を区別できる。
  • CPU/GPUの仕様を単一指標でなく目的に沿って読める。
  • 12週間の内容を10分で一貫して説明できる。

まず、具体的な場面から

PCの一般操作

CPUがOSや分岐の多い処理を担当。

画像・AIの大量計算

GPUや専用演算器が同型処理を担当。

AIサーバー全体

HBM、ネットワーク、電源、冷却も性能を決める。

見えてくること:用途が違えば重視する指標も違います。チップ単体ではなく、製品・ソフトウェア・供給網までつなげて考えます。

ここで初めて、見えてきた関係を言葉や記号でまとめます。

用途 → 処理の形 → 必要な部品 → メモリ・電力・冷却 → 実測

IDMは設計と製造を社内で行い、ファブレスは設計中心、ファウンドリは製造受託、OSATは組立・試験受託です。

なぜそうなる?

小さく逐次依存の強い処理はCPUの低い待ち時間が活きやすく、大量の似た計算はGPUが並列性を活かしやすい。ただし転送やソフトウェアで結果が変わります。

講義ノートで詳しく読む

元のMarkdownにある仕組み・図・用語を、順番に確認します。

1. 製品の中の半導体

PC

  • CPU:OS、アプリ、分岐の多い汎用処理。
  • GPU:描画、映像、AI、並列計算。
  • DRAM:実行中のコードとデータ。
  • NAND:SSDの不揮発記憶。
  • 電源管理IC・MOSFET:各部へ適切な電圧を供給。
  • 通信IC:Wi-Fi、Bluetooth、Ethernetなど。
  • センサー:温度、カメラ、指紋など。

スマートフォン

CPU、GPU、AIアクセラレーター、画像信号処理、通信モデムなどをSoCへ統合します。省電力が重要なため、高性能コアと高効率コアを組み合わせる場合があります。

自動車

制御用マイコン、パワー半導体、センサー、通信、先進運転支援用プロセッサなどが使われます。温度、寿命、機能安全、長期供給といった条件が民生PCと異なります。

AIサーバー

CPUがシステム制御とデータ準備を担い、GPUや専用アクセラレーターが行列演算を担当します。GPU単体だけでなく、HBM、ネットワーク、電源、冷却、ソフトウェアが全体性能を決めます。

2. 半導体産業の役割

EDA・設計IP
    ↓
設計(ファブレス / IDM)
    ↓
製造(ファウンドリ / IDM)← 装置・材料
    ↓
組立・検査(OSAT / IDM)
    ↓
電子機器・クラウド・自動車など
  • IDM:設計と製造を社内で行う。
  • ファブレス:設計を中心に行い、製造を委託。
  • ファウンドリ:他社設計の製造を受託。
  • OSAT:後工程の組立・パッケージ・試験を受託。
  • EDA:設計、検証、物理実装を支援するツール。
  • IPベンダー:CPUコア、インターフェースなど再利用可能な設計を提供。
  • 装置・材料:露光、成膜、エッチング、検査、ウェハー、ガス、薬品など。

一社だけで先端CPU/GPUを完成できるわけではなく、国際的な専門分業で成り立ちます。

3. CPU仕様の読み方

確認する順序:

  1. 目的のソフトウェアとISA互換性。
  2. 単一thread性能が重要か、並列性能が重要か。
  3. 物理コア数とハードウェアthread数。
  4. 世代、マイクロアーキテクチャ、クロック、電力枠。
  5. キャッシュと対応メモリ。
  6. 実際の対象ワークロードによるベンチマーク。

GHz×コア数だけで比較しません。ベンチマークは測定条件、電力設定、冷却、ソフトウェアバージョンも確認します。

4. GPU仕様の読み方

確認する順序:

  1. 用途:描画、動画、AI、科学計算など。
  2. 対応ソフトウェア、API、ライブラリ。
  3. VRAM容量と帯域。
  4. 対象精度での演算性能。
  5. 消費電力と冷却。
  6. CPU・メモリ・接続を含むシステム全体。
  7. 実ワークロードのベンチマーク。

「コア数」はベンダー、世代、演算器種別が違うと比較しにくいため、同じ条件の実測を優先します。

5. CPUとGPUの判断フロー

処理を多数の独立要素へ分けられるか?
├─ いいえ → CPUが中心
└─ はい
   ├─ 同じ演算が多いか?
   │  ├─ いいえ → CPUまたは別アクセラレーターを検討
   │  └─ はい
   │     ├─ 十分大きな問題か?
   │     │  ├─ いいえ → 起動・転送コストからCPUの可能性
   │     │  └─ はい → GPU候補
   │     └─ メモリアクセスと分岐を整理できるか確認

例題で確かめる

例題

小さく逐次依存の強い探索と、大きな画像の同じフィルター処理。どちらをCPU/GPU候補にする?

  1. 探索は前の結果を待つので、独立した仕事へ分けにくい。
  2. 画像フィルターは多くの画素へ似た演算を適用できる。
  3. データ転送と起動時間も含めて実測する。

答え:探索はCPUが一般に有利。十分大きな画像のフィルター処理はGPU候補です。

総合課題

10分の説明資料を6枚で作ります。

Slide 1:半導体とは何か

  • シリコン、キャリア、ドーピング。
  • 電気の流れを制御できることが重要。

Slide 2:MOSFETから論理回路へ

  • nMOS、pMOS、CMOSインバーター。
  • 論理ゲート、加算器、レジスタ。

Slide 3:CPUはどう命令を実行するか

  • ALU、レジスタ、PC、メモリ。
  • IF、ID、EX、MEM、WB。

Slide 4:CPUをどう高速化するか

  • パイプライン、キャッシュ、分岐予測、OoO、マルチコア。
  • レイテンシー重視。

Slide 5:GPUはなぜ大量計算に強いか

  • thread、warp、block、SM。
  • SIMT、高帯域、メモリ、分岐ダイバージェンス。
  • スループット重視。

Slide 6:製造・用途・結論

  • 前工程、パッケージ、電力・歩留まり。
  • CPUとGPUが協調する具体例。
  • 単一指標で性能を判断しない。

最終口頭試問

資料を見ず、次の三問へ答えます。

  1. なぜCPUだけですべての計算を行わず、GPUを併用するのか。
  2. MOSFETがどのようにCPUの命令実行へつながるのか。
  3. コア数、クロック、キャッシュ、帯域、消費電力をどう見ればよいか。

評価基準:

観点 0 1 2 3
正確さ 大きな誤り 一部正しい 概ね正しい 例外も含め正確
因果関係 用語の羅列 一部つながる 始点から終点までつながる トレードオフも説明
図 なし 不完全 正しい 図が説明を助ける
具体例 なし 1例 適切な複数例 CPU/GPU両方を比較

合計12点中9点以上を修了基準とします。

練習問題

元ノートの小テストです。まず自分で答えを考え、必要なら下の答えを開いてください。

  1. 設計を中心に行い製造を委託する企業形態は何か。

    答えと考え方を見る

    ファブレス。

  2. 他社設計のウェハー製造を受託する企業形態は何か。

    答えと考え方を見る

    ファウンドリ。

  3. AIサーバーの性能がGPU単体だけで決まらない理由を二つ挙げよ。

    答えと考え方を見る

    例:HBM容量・帯域、CPU側の準備、GPU間ネットワーク、ストレージ、電源、冷却、ソフトウェア最適化が全体性能を制限するため。

  4. CPU/GPUのコア数をベンダー横断で直接比較しにくい理由は何か。

    答えと考え方を見る

    ベンダーや世代で「コア」の構造、実行幅、機能、クロックが異なり、同じ仕事量を表さないため。

  5. 逐次依存が強く小規模な処理は、CPUとGPUのどちらが一般に有利か。その理由も答えよ。

    答えと考え方を見る

    一般にCPU。並列分割しにくく、GPU起動・転送コストを回収できず、CPUの低レイテンシー制御が有利だから。

次の学習分岐

  • CPU設計:Nand2Tetrisを完走し、RISC-V、Verilog、FPGAへ進む。
  • GPU計算:Python/C++、CUDAまたは対応する並列API、profilingへ進む。
  • 半導体デバイス:MOS電気特性、デバイス方程式、プロセス、TCADへ進む。
  • AIハードウェア:行列計算、量子化、メモリ階層、分散学習へ進む。
  • 産業分析:企業の役割、設備投資、需給、技術ロードマップを継続調査する。