最強のローカルAIエージェント型コーディング環境構築ガイド(完全版)
概要
ここ数ヶ月でローカルLLMの性能が大きく向上し、インターネット接続やサブスクリプション費用なしで、自分のPC上だけで本格的なエージェント型コーディング(ファイル編集・bash実行など)が可能になった。動画ではハードウェアに応じたモデル選定から、LM StudioとVS Codeを使った実際のセットアップ手順までを解説している。
主なポイント
- モデルサイズの上限はVRAM(Windowsはグラフィックカードのビデオメモリ、MacはUnified Memory)でほぼ決まり、実用上使えるのは全体の75〜85%程度
- 目安表:VRAM 8GBで7Bパラメータ、12〜16GBで14B、24GBで32B、64GB以上で70Bクラスのモデルが動く
- ローカル開発には2種類のモデルが必要:高速・軽量なオートコンプリート用モデル(Qwen2.5 Coder 1.5B)と、tool use対応の大きめなチャット/編集/エージェント用モデル
- エージェント用モデルには「tool use」対応が必須。これがないとコードの提案はできてもファイル作成・編集などの実行操作ができない
- 量子化(フル/Q6/Q4など)でモデルサイズと速度が変わる。VRAMに収まる範囲でできるだけ低い量子化(=小さいサイズ)を選ぶと速度が向上
- 「A3B」などのActive Parameters表記のMoE系モデルは、全体は大きくても実際にGPUで動く部分が少なく、非力なハードでも大きめのモデルを動かせる
- おすすめモデル:ハイエンド機ではQwen3.6 35B A3B(Q4で約22GB)やQwen3 Coder Next(約44GB)、一般的な環境ではQwen3.6 14Bクラスが目安
- セットアップ手順:LM Studioでモデルをダウンロードし、Developer画面でローカルサーバーを起動、VS Codeの新機能「Manage Language Models」からカスタムOpenAI互換エンドポイントとして追加
- LM Studio上ではGPUオフロードを最大にし、VRAMに収まる範囲でコンテキスト長を調整するのがパフォーマンスの鍵
- オートコンプリートをローカルで動かすには「Continue」拡張機能を使い、roles設定でautocomplete用モデルを指定する
実践に使えること
- 自分のPCのVRAM(WindowsはタスクマネージャーでGPU、MacはAboutこのMacでUnified Memoryを確認)から、その75〜80%を目安に動かせるモデルサイズを見積もる
- LM StudioとVS Codeをインストールし、オートコンプリート用の軽量モデル(Qwen2.5 Coder 1.5B)とtool use対応のチャット/エージェント用モデル(Qwen3.6やQwen3 Coder Nextなど)の2種類をダウンロードする
- LM StudioのDeveloper画面でサーバーを起動し、両モデルをプリロードしてから、VS Codeのコマンドパレット(Cmd/Ctrl+Shift+P)→「Manage Language Models」→「Add Models」→Custom Endpointで、LM StudioのAPI URL・モデルID・名前を登録する
- モデル追加時はGPUオフロードを最大に、コンテキスト長はVRAMと相談しながら調整して応答速度を確保する
- Continue拡張機能をインストールし、config内でroles: [“autocomplete”]を指定してオートコンプリート専用モデルを設定すれば、オフラインでも補完が効くようになる