GPU
GPUはグラフィックス処理や大規模な並列計算を担い、AIモデルの学習と推論にも使われるプロセッサーである。
GPUは、多数の計算を並列に実行するよう設計されたグラフィックス処理用のプロセッサーである。幅広い処理を担うCPUと比べて並列計算に適しており、グラフィックス表示のほか、AIモデルの学習や推論にも使われる。
大規模言語モデルを動かす際には、GPUのメモリー容量と帯域幅が重要になる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
16GBや24GBの一般向けGPUに載せても、モデルが作業中に参照するテキストであるコンテキストのための空きが十分に残ります。
また、数千基のGPUでフロンティアモデルを学習させるのとは違い、ハーネスの構築は通常のソフトウェア開発であり、個人の開発者にも開かれています。
Gemma 4は寛容なApache 2.0ライセンスで提供され、スマートフォンで動く2Bモデルから1枚のGPUに収まる31Bモデルまで5つのサイズがあります。
cmuxは、GPUアクセラレーションに対応したターミナルGhosttyの基盤となるライブラリlibghosttyの上に、ElectronではなくネイティブのSwiftとAppKitで作られています。
同社はまず、自社モデルの学習に使っていない旧世代のNVIDIA GPUの提供から始めました。
FluxやZ-Imageのようなオープンソースのモデルは、十分な性能のローカル環境やレンタルGPUで動かせ、重みをダウンロードしてカスタマイズできます。
RunPod Flashを使うと、独自のDockerfileを書かずにPythonのモデルコードをデプロイでき、アイドル状態のGPUワーカーを停止できるため、画像生成サービスの運用コストを下げられる可能性があります。
どちらもコード変更を提案し、共有GPUクラスターに学習ジョブを投入し、得られたログを読んで、次に何を試すかを決められました。
イーロン・マスクは、メンフィスにあるxAIの施設Colossus 2に、NVIDIAのGB200とGB300のGPUを55万基導入したと述べました。
専用GPUならグラフィックスカード上のメモリであるVRAM、Apple Silicon搭載Macなら共有メモリであるユニファイドメモリです。
両機ともGPUコアは80基です。