声で話せるAIアシスタントを作ってみた〜Whisper+ローカルLLM+VOICEVOXを1つに統合(完全ローカル)〜
マイクで話す→AIが答える→声で返す、を全部Macローカルで。音声認識Whisper・ローカルLLM(Ollama+Qwen2.5)・音声合成VOICEVOXを1つのデスクトップアプリに統合しました。クラウドに送らないのでプライバシー安心・無料・オフラインOK。コード・モデル・設定値・つまずきまで再現できるよう解説します。
プログラミングや3DCGで何か作りたいと思っているエンジニアがいます
マイクで話す→AIが答える→声で返す、を全部Macローカルで。音声認識Whisper・ローカルLLM(Ollama+Qwen2.5)・音声合成VOICEVOXを1つのデスクトップアプリに統合しました。クラウドに送らないのでプライバシー安心・無料・オフラインOK。コード・モデル・設定値・つまずきまで再現できるよう解説します。
RAG(Retrieval-Augmented Generation)とは、LLMが知らない情報を外部ドキュメントから検索して補う仕組みです。OllamaのローカルLLM(llama3.2:3b)とnumpyだけで最小構成のRAGを実装し、実際に動かしてみました。