Macのデスクトップアプリに軽量ローカルLLMを組み込んでオフライン動作させてみた〜“端末の中で動くAI”をMacで〜
ネット接続なしで動くAIアプリをMacで自作。軽量LLM(Qwen2.5-3B・gguf)をllama-cpp-pythonでデスクトップアプリに直接組み込み、PySide6のGUIで文章生成・要約をオフライン実行。Apple SiliconのGPU(Metal)で約38トークン/秒。インストール・モデル・コード・設定値まで再現できるよう解説します。
プログラミングや3DCGで何か作りたいと思っているエンジニアがいます
ネット接続なしで動くAIアプリをMacで自作。軽量LLM(Qwen2.5-3B・gguf)をllama-cpp-pythonでデスクトップアプリに直接組み込み、PySide6のGUIで文章生成・要約をオフライン実行。Apple SiliconのGPU(Metal)で約38トークン/秒。インストール・モデル・コード・設定値まで再現できるよう解説します。
RAG(Retrieval-Augmented Generation)とは、LLMが知らない情報を外部ドキュメントから検索して補う仕組みです。OllamaのローカルLLM(llama3.2:3b)とnumpyだけで最小構成のRAGを実装し、実際に動かしてみました。