最高のローカルAIコーディングワークフロー完全ガイド
概要
AIサービスの月額プランが割高になったことを受け、Kyle CookがAPI課金なしで完全プライベート・高速に動くローカルAI環境の構築方法を解説する動画。チャット・オートコンプリート・エージェントモードのすべてをローカルモデルで実現する方法を、概念レベルから丁寧に説明している。
主なポイント
- モデル選定では「パラメータ数」と「コンテキストサイズ」がモデルサイズを決める最重要要素で、実行にはGPUのVRAM容量が最大の制約になる
- VRAMを超えるモデルはシステムRAMに溢れ(オーバーフロー)、処理速度が大幅に低下する(実測で120+ tokens/秒→20〜30 tokens/秒まで低下)
- Macは統合メモリのためVRAMとシステムRAMが共有され、より大きなモデルを載せやすい
- モデル管理ツールはLM Studioを推奨。Hugging Faceと連携してモデル探索・ダウンロードができる
- 量子化(Q4/Q6/Q8など)はモデルサイズと精度のトレードオフで、Q4が実用上の良いバランス
- エージェント的コーディングには「Tool use(ツール呼び出し)」と「Reasoning(推論・思考)」対応モデルを選ぶ必要がある
- MoE(Mixture of Experts)モデルは一部の重み(レイヤー)だけをCPU/システムRAMに逃がすことで、大型モデルでも実用速度を維持できる裏技的手法
- LM StudioのDeveloperタブでOpenAI互換APIサーバーを起動でき、VS Code拡張(Continue)などの外部ツールから接続可能
- Continue拡張でオートコンプリート用に小型モデル(例: Qwen2.5 Coder 1.5B)、エージェント用に大型モデルを使い分けて設定する
実践に使えること
- 自分のGPUのVRAM容量(タスクマネージャーの「専用GPUメモリ」など)を確認し、それに収まるサイズ・量子化(Q4目安)のモデルを選ぶ
- エージェント的コーディングに使うモデルは「Tool use」「Reasoning」対応かをLM Studioの表示で確認してから導入する
- 大型モデルを使いたい場合はMoE対応モデルを選び、LM StudioのGPUオフロードを最大化しつつ「MoE weightsをCPUに逃がすレイヤー数」を少しずつ増やして速度とサイズのバランスを探る
- オートコンプリート用には応答速度重視で1B級の小型モデル、エージェント用には精度重視で中〜大型モデルと役割を分けて運用する
- VS Codeに「Continue」拡張を入れ、LM StudioのAPIエンドポイント(/v1)を指定してオートコンプリートとエージェントモードの両方をローカルモデルで動かす