#AI
47 件の記事
LLM のハルシネーション(幻覚)— 原因と実務での対策
LLM がもっともらしい嘘を自信満々に生成するハルシネーションを整理します。次トークンの確率予測という動作原理から幻覚が必然的に生まれる理由、事実誤り・出典の捏造・コード API の幻覚といった類型、RAG と引用の強制、ツール利用、構造化出力の検証、評価パイプラインまで実務で幻覚を減らす手段、そして完全にはなくせない前提の上で人間のレビューポイントを設計する運用の視点まで扱います。
埋め込みとベクトル検索 — 意味で探す検索の仕組み
RAG とセマンティック検索の基盤である埋め込み(エンベディング)とベクトル検索を 1 本で整理します。テキストを数値ベクトルに変換する埋め込みの概念、コサイン類似度で意味の近さを測る原理、全件走査の kNN と近似検索 ANN のトレードオフ、pgvector・専用ベクトル DB・検索エンジン拡張からストレージを選ぶ基準、キーワードの完全一致に弱い埋め込みの限界とハイブリッド検索、モデル変更時の全再インデックスといった運用コストまで扱います。
トークンとコンテキストウィンドウ — LLM のコストと限界を決める単位
LLM の料金表とスペック表に必ず登場するトークンとコンテキストウィンドウを 1 本で整理します。テキストがどうトークンに分割されるのか、日本語が英語よりトークンを多く消費する理由、入力と出力で単価が異なる料金構造と会話が長くなるほどコストが膨らむ仕組み、コンテキストウィンドウが実際に制限しているもの、長大なコンテキストの性能面の落とし穴、プロンプトキャッシュや履歴管理といった実務での対策まで扱います。
MCP(Model Context Protocol)整理 — AI がツールを使う標準
AI エージェントの記事のたびに登場する MCP を 1 本で整理します。ツール連携の N×M 問題を標準インターフェースで解く構造、Function Calling との関係、ホスト・クライアント・サーバーと tools・resources・prompts のプリミティブ、2026 年現在の採用状況と財団への移管、サードパーティサーバーの信頼やプロンプトインジェクションといったセキュリティの注意点、導入が必要な場合とそうでない場合まで扱います。
RAG vs ファインチューニング vs ロングコンテキスト — LLM に知識を入れる方法の選択
LLM に自社データを入れる 3 つの方法を分ける実務基準を整理します。検索して注入する RAG、重みを変えるファインチューニング、丸ごと入れてキャッシュするロングコンテキストの構造の違い、ファインチューニングは知識ではなく振る舞いを教える道具だという境界、更新頻度と知識のサイズで分ける判断の手順、3 つを組み合わせる実戦構成まで扱います。
GPU クラウドの選択 — ハイパースケーラー vs 専用 GPU クラウド vs サーバーレス推論
AI ワークロード用の GPU をどこで借りるかを分ける実務基準を整理します。ハイパースケーラー(AWS)と専用 GPU クラウド(Lambda・RunPod)の H100 時間単価が 2〜5 倍開く理由、スポットが半分以下に下がる代わりに受け入れるもの、サーバーレス推論がトークン単位課金で GPU 管理を不要にする場面、そして統合・ネットワーク・規制の要件が料金差を覆す条件まで扱います。
LLM 量子化比較 — FP16・INT8・INT4 と GGUF・AWQ・GPTQ
LLM の量子化方式を選ぶ実務基準を整理します。精度(FP16・INT8・INT4)が VRAM を半分ずつ減らす仕組み、70B モデルが 140GB から 35GB に下がる計算、GGUF・AWQ・GPTQ の三形式が分かれる用途(ローカル・GPU サービング・精度)、INT4 が推論・コードの作業で品質を落とすところ、サービングフレームワークと形式を合わせる方法まで扱います。
vLLM vs Ollama vs SGLang — LLM サービングフレームワークの選択
LLM を自己ホスティングするときのサービングフレームワークを選ぶ基準を整理します。ローカル実行向け(Ollama)とプロダクションのスループット向け(vLLM・SGLang)が分かれるところ、PagedAttention と連続バッチングがスループットを 3〜4 倍広げる理由、TGI がメンテナンスモードに入った 2026 年の地形変化、量子化・構造化出力のサポートの違い、そしてチーム規模ごとの選択の手順まで扱います。
LLM API vs 自己ホスティング — 損益分岐の計算
LLM を API で使うか自分でホスティングするかを分ける実務基準を整理します。トークン単位課金と GPU 時間単位課金の構造の違い、GPU 1 枚が 1 日に出すトークン数で損益分岐を計算する方法、常時稼働率とバッチ・量子化が分岐点を動かす要因、料金の外で決定を分けるデータプライバシー・遅延・運用負担まで扱います。
LLM セルフホスティングに必要なサーバー規模の見積もり — VRAM 計算から同時ユーザーまで
社内 LLM をセルフホスティングするときに必要な GPU 規模を見積もる手順を整理します。パラメータ数と精度で行う VRAM 計算、KV キャッシュと同時リクエストの関係、メモリ帯域とトークン生成速度、シナリオ別の構成例、セルフホスティングと API の損益分岐まで扱います。
AI の学習サーバーと推論サーバーの違い — スペックが分かれるポイント
同じ GPU サーバーなのに学習用と推論用でスペックが分かれる理由を整理します。バッチ処理とリクエスト処理というワークロード形態の違い、GPU 間通信とメモリ帯域というボトルネックの違い、精度と量子化、コスト構造と兼用の罠まで、機材選択の観点で扱います。
NVIDIA GPU の名前の読み方 — アーキテクチャ世代と製品ラインの整理
H100、B200、GB300、L40S、RTX 5090 のような NVIDIA GPU の名前を体系として読む方法を整理します。科学者名のアーキテクチャ世代の軸と、データセンター・推論・コンシューマーの製品ラインの軸、数字と接頭辞の意味、2026 年半ば時点の世代の現況とロードマップまで扱います。