AI

LLM のハルシネーション(幻覚)— 原因と実務での対策
読了 6分

LLM のハルシネーション(幻覚)— 原因と実務での対策

LLM がもっともらしい嘘を自信満々に生成するハルシネーションを整理します。次トークンの確率予測という動作原理から幻覚が必然的に生まれる理由、事実誤り・出典の捏造・コード API の幻覚といった類型、RAG と引用の強制、ツール利用、構造化出力の検証、評価パイプラインまで実務で幻覚を減らす手段、そして完全にはなくせない前提の上で人間のレビューポイントを設計する運用の視点まで扱います。

埋め込みとベクトル検索 — 意味で探す検索の仕組み
読了 6分

埋め込みとベクトル検索 — 意味で探す検索の仕組み

RAG とセマンティック検索の基盤である埋め込み(エンベディング)とベクトル検索を 1 本で整理します。テキストを数値ベクトルに変換する埋め込みの概念、コサイン類似度で意味の近さを測る原理、全件走査の kNN と近似検索 ANN のトレードオフ、pgvector・専用ベクトル DB・検索エンジン拡張からストレージを選ぶ基準、キーワードの完全一致に弱い埋め込みの限界とハイブリッド検索、モデル変更時の全再インデックスといった運用コストまで扱います。

トークンとコンテキストウィンドウ — LLM のコストと限界を決める単位
読了 6分

トークンとコンテキストウィンドウ — LLM のコストと限界を決める単位

LLM の料金表とスペック表に必ず登場するトークンとコンテキストウィンドウを 1 本で整理します。テキストがどうトークンに分割されるのか、日本語が英語よりトークンを多く消費する理由、入力と出力で単価が異なる料金構造と会話が長くなるほどコストが膨らむ仕組み、コンテキストウィンドウが実際に制限しているもの、長大なコンテキストの性能面の落とし穴、プロンプトキャッシュや履歴管理といった実務での対策まで扱います。

MCP(Model Context Protocol)整理 — AI がツールを使う標準
読了 6分

MCP(Model Context Protocol)整理 — AI がツールを使う標準

AI エージェントの記事のたびに登場する MCP を 1 本で整理します。ツール連携の N×M 問題を標準インターフェースで解く構造、Function Calling との関係、ホスト・クライアント・サーバーと tools・resources・prompts のプリミティブ、2026 年現在の採用状況と財団への移管、サードパーティサーバーの信頼やプロンプトインジェクションといったセキュリティの注意点、導入が必要な場合とそうでない場合まで扱います。

RAG vs ファインチューニング vs ロングコンテキスト — LLM に知識を入れる方法の選択
読了 6分

RAG vs ファインチューニング vs ロングコンテキスト — LLM に知識を入れる方法の選択

LLM に自社データを入れる 3 つの方法を分ける実務基準を整理します。検索して注入する RAG、重みを変えるファインチューニング、丸ごと入れてキャッシュするロングコンテキストの構造の違い、ファインチューニングは知識ではなく振る舞いを教える道具だという境界、更新頻度と知識のサイズで分ける判断の手順、3 つを組み合わせる実戦構成まで扱います。

GPU クラウドの選択 — ハイパースケーラー vs 専用 GPU クラウド vs サーバーレス推論
読了 5分

GPU クラウドの選択 — ハイパースケーラー vs 専用 GPU クラウド vs サーバーレス推論

AI ワークロード用の GPU をどこで借りるかを分ける実務基準を整理します。ハイパースケーラー(AWS)と専用 GPU クラウド(Lambda・RunPod)の H100 時間単価が 2〜5 倍開く理由、スポットが半分以下に下がる代わりに受け入れるもの、サーバーレス推論がトークン単位課金で GPU 管理を不要にする場面、そして統合・ネットワーク・規制の要件が料金差を覆す条件まで扱います。

LLM 量子化比較 — FP16・INT8・INT4 と GGUF・AWQ・GPTQ
読了 5分

LLM 量子化比較 — FP16・INT8・INT4 と GGUF・AWQ・GPTQ

LLM の量子化方式を選ぶ実務基準を整理します。精度(FP16・INT8・INT4)が VRAM を半分ずつ減らす仕組み、70B モデルが 140GB から 35GB に下がる計算、GGUF・AWQ・GPTQ の三形式が分かれる用途(ローカル・GPU サービング・精度)、INT4 が推論・コードの作業で品質を落とすところ、サービングフレームワークと形式を合わせる方法まで扱います。

vLLM vs Ollama vs SGLang — LLM サービングフレームワークの選択
読了 5分

vLLM vs Ollama vs SGLang — LLM サービングフレームワークの選択

LLM を自己ホスティングするときのサービングフレームワークを選ぶ基準を整理します。ローカル実行向け(Ollama)とプロダクションのスループット向け(vLLM・SGLang)が分かれるところ、PagedAttention と連続バッチングがスループットを 3〜4 倍広げる理由、TGI がメンテナンスモードに入った 2026 年の地形変化、量子化・構造化出力のサポートの違い、そしてチーム規模ごとの選択の手順まで扱います。

LLM API vs 自己ホスティング — 損益分岐の計算
読了 6分

LLM API vs 自己ホスティング — 損益分岐の計算

LLM を API で使うか自分でホスティングするかを分ける実務基準を整理します。トークン単位課金と GPU 時間単位課金の構造の違い、GPU 1 枚が 1 日に出すトークン数で損益分岐を計算する方法、常時稼働率とバッチ・量子化が分岐点を動かす要因、料金の外で決定を分けるデータプライバシー・遅延・運用負担まで扱います。

LLM アプリ運用 #7 実践:ドキュメント Q&A ボットを本番へ
読了 5分

LLM アプリ運用 #7 実践:ドキュメント Q&A ボットを本番へ

シリーズの五つの軸を運用チェックリストにまとめ、ドキュメント Q&A ボットに適用します。計測、ルーティング、キャッシング、バッチ、信頼性、セキュリティを一つずつ有効にしながら、リクエストあたりのコストと安定性がどう変わるかを確かめ、四つのシリーズにわたる AI トラックを締めくくります。

LLM アプリ運用 #6 セキュリティ — プロンプトインジェクションとデータ境界
読了 6分

LLM アプリ運用 #6 セキュリティ — プロンプトインジェクションとデータ境界

プロンプトインジェクションは入力テキストでアプリの動作を変えようとする試みで、RAG とエージェントの時代には文書やツール結果を経由して入り込みます。単一の防御線ではなく何層もの防御、ツール権限の最小化、出力の検証、ロギングのデータ境界まで扱います。

LLM アプリ運用 #5 信頼性 — レートリミット・リトライ・フォールバック
読了 6分

LLM アプリ運用 #5 信頼性 — レートリミット・リトライ・フォールバック

429 と 529 は障害ではなく日常です。レートリミットの仕組み(RPM・トークン上限)、retry-after を尊重するリトライ、タイムアウトとストリーミング、それでもだめなときのフォールバック(モデル格下げ・キューイング・丁寧な失敗)まで、止まらない構造を作ります。