30Bの中から毎回3Bだけ使う――「Nemotron 3.5 Lightning」をローカルで

くまごろう
2026/9/27
2026/9/27

AIが資料を読み、道具を使い、失敗したらやり直す。そんな長めの作業を手元のPCに任せるため、NVIDIAの「Nemotron 3.5 Lightning」がOllamaで利用可能になりました。2026年8月の発表によると、全体では30B規模ですが、答えを作る各段階で使う部分は約3B。必要な「専門家」だけを呼び出す構造です。


これにより計算を効率化しますが、保存するモデル全体まで3Bサイズになるわけではありません。Ollamaの量子化版も約25GBあり、実行には相応のメモリが必要です。小型モデル並みの軽さと誤解せず、手元で動く作業型AIの新しい選択肢として見てみましょう。


コメント

コメントはまだありません。

このサイトの内容について質問してください。