トピックス
コラム
現代の企業や経営者が直面する重要な問題について、専門家であるコラムニストが意見や分析を提供しています。
このシリーズをもっと見る


Carolyn Geason-Beissel/MIT SMR|Getty Images
ビジネスリーダーは現在、自社が人工知能や生成型AIツールを導入するにつれて、ワークフロー、組織設計、その他の分野を再考しています。
私の仕事では MIT スローン経営大学院で、私は過去 2 年間、多くの経営幹部に大規模言語モデル (LLM) がどのように機能するかの基本を教えてきました。
ビジネスリーダーは、LLM や LLM が活用する生成 AI ツールがどのように機能するかを知りたくないし、知る必要もなく、興味があるのは、 結果 ツールはそれを実現できます。
このコラムでは、よく聞かれる10のよくある誤解についての質問とその回答を紹介します。
GenAI と LLM に関する 10 の重要な質問と回答
1. LLM が一度に 1 つのテキストを出力することを理解しています。
別の言い方をすると、LLM はいつユーザーに質問に対する最終的な答えを与えることを決定するのでしょうか?
LLM が質問に答えると、一度に 1 つずつ小さなテキストが生成されます。 トークン.1 トークンは単語または単語の一部です。 そして これまでにすでに書いたこと。2
外部システムは、「次のトークンを生成し、それを入力に追加し、次のトークンを生成する」ループで LLM を実行します。 停止条件 がトリガーされます。
実際には多くの停止条件が使用されます。 停止シーケンス.
ChatGPT のようなツールの Web バージョンをコンシューマとして使用すると、このプロセスは表示されず、完成したテキストのみが表示されます。
ここで重要な点は、停止の「決定」は LLM のトークン予測と外部制御ロジックの間の相互作用であり、LLM によって行われる決定ではないということです。
2. LLM が間違いを犯し、それを修正した場合、LLM はすぐに更新されますか?
いいえ、LLM を修正しても、LLM はすぐには更新されません。
ChatGPT などの一部のアプリには、名前、設定、場所などの個人情報を記憶するためにリアルタイムで更新できるメモリ機能があります。
3. LLM が現在の会話に基づいて一度に 1 つのトークンを繰り返し生成する場合、応答で以前の会話 (たとえば、1 週間前) の情報が使用されるのはなぜですか?
LLM は、会話で与えられた入力に基づいて、一度に 1 トークンずつ応答を生成します。
新しいチャットを開始すると、この保存されたメモリの関連部分が削除される可能性があります。 自動的に プロンプトに追加されました 舞台裏で。
何をいつ保存するかはベンダーによって異なり、正確な方法は明らかにされていません。
RAG に詳しくない方のために説明すると、RAG は、LLM に特定の独自データのセットへのアクセスを提供するために使用される手法です。
4. LLM にはトレーニング終了日があり、その日以降に起こったことについては「知らない」ことを理解しています。 できる 起こった出来事についての質問に答える その後 締切日。
LLM のトレーニング終了日以降に起こった何かについて質問した場合、最新情報にアクセスできない限り、モデル自体はそのイベントについて「認識」しません。
ライブデータにアクセスできない場合、モデルは現実世界の更新を反映していないトレーニング データに基づいて回答を生成する可能性があります。
そのような場合、LLM は質問に基づいて検索クエリを生成し、システムの別の部分 (モデル自体の外側) が検索を実行します。
5. プロンプトの一部としてドキュメントを含める場合、LLM が応答を生成するときに提供されたドキュメントのみを使用するようにできますか?
いいえ、慎重なプロンプトや RAG などの手法により、AI モデルが提供された一連のドキュメントを優先するように促すことができますが、標準 LLM がそのコンテンツのみを使用することを強制することはできません。
6. LLM は、質問に対する回答を生成するために使用された情報源を引用することがあります。
いいえ、LLM は引用を捏造 (幻覚) させたり、不正確または誤解を招く方法で実際の情報源を使用したりする可能性があります。
7. 多数のドキュメントがある場合は、RAG を使用します。RAG では、最初にドキュメントから関連情報を収集し、それらのみをプロンプトに含めます。 全て 書類。
GPT-4.1 や Gemini 2.5 などの最新の LLM は、本全体を保持できるほどの 100 万トークンのコンテキスト ウィンドウを提供します。
これらの拡張コンテキスト ウィンドウは強力ですが、プロンプトにすべてのドキュメントを含めることが常に良いアイデアであるとは限りません。
まず、RAG は単にプロンプトを短くするだけではありません。 コンテキストのオーバーロード 情報が多すぎる、または無関係な情報があるとパフォーマンスが低下する可能性があり、コンテキストとプロンプトを適切で簡潔かつ正確に保つことが、より良い回答につながることがよくあります。
第 2 に、LLM は長いコンテキストを受け入れることができますが、すべての部分を同じように適切に処理できるわけではありません。
最後に、プロンプトが長くなるとトークンが多くなり、API コストが増加し、応答が遅くなります。
つまり、長いコンテキスト ウィンドウは便利ですが、だからといって検索が時代遅れになるわけではありません。 評価された 特定のアプリケーションのニーズに基づいて。
8. LLM 幻覚を取り除くことはできますか?
いいえ、現在の LLM テクノロジーでは幻覚を完全に取り除くことはできません。
ただし、RAG などの慎重なプロンプト エンジニアリングと戦略、ドメイン固有のデータの微調整、ルールベースのチェックや外部検証による後処理により、 幻覚を減らす 特定の使用例で。3 これらの戦略は幻覚の除去を保証するものではありませんが、多くの実際のアプリケーションに対して LLM の信頼性を十分に向上させることができます。
9. LLM の幻覚や間違いをなくすことはできないので、答えを確認する必要があります。
LLM 出力を効率的にチェックできるかどうかは、タスクの種類と許容可能なリスク レベルによって異なります。
要約、エッセイ、レポート、分析などの無制限のタスクの場合、人間によるレビューが最も信頼性の高い監視を提供します。
ますます人気が高まっている代替手段は、「AI ジャッジ」を使用することです。これは通常、最初のツールの出力を評価または検証できる別の LLM です。
「AI ジャッジ」は通常、最初のツールの出力を評価または検証するために使用される別の LLM です。
コードの生成、情報の分類、SQL や JSON などの形式での構造化データの生成などの構造化タスクは、自動化が容易になります。
要約すると、最も効率的なチェック戦略は自動化と人間による監視を組み合わせたものです。
10. 私たちは LLM ベースのチャットボットを構築しており、異なるユーザーが同じ質問をしたとき (または 1 人のユーザーが異なる時間に同じ質問をしたとき)、質問に対する回答が変わらないことを保証したいと考えています。
「保証」という言葉が意味するのであれば、 その通り 毎回同じ言葉遣いですが、簡単に言うと「ノー」です。
同じ質問が、異なる言葉を使用して異なる機会に提示された場合、LLM の答えは変わる可能性が非常に高くなります。 その通り 毎回同じ答えが生成されます。
特定の LLM 設定 (「温度」をゼロに設定するなど) を構成したり、正確なモデル バージョンをロックしたり、ハードウェアとソフトウェア スタック全体を制御できるように自己ホストしたりすることで、ばらつきを減らすことができます。4 したがって、根本的な答えの意味を変えることのない、小さな表現や強調の変更が依然として時々見られることがあります。
同一の文言を真に保証する唯一の方法は、最初に回答が生成されたときに回答を保存 (キャッシュ) し、同じ質問が検出されるたびにその保存されたテキストを提供することです。
つまり、回答を非常に一貫性のあるものにすることはできますが、現在のテクノロジーでは 100% の表現を保証することは不可能です。
参考文献
1. 平均して、トークンは単語の約 4 分の 3 であり、最新の LLM の語彙は数万から 100,000 トークンを超えます。 OpenAIのTokenizerツール より深い理解を得るために単語がどのようにトークン化されるかを見てください。
2. 厳密に言うと、入力が与えられると、LLM は語彙内の各トークンの確率 (つまり、0.0 から 1.0 までの数値) を生成します。
3. このトピックに関する学術研究の最近の調査については、Y. Wang、M. Wang、M.A. Manzoor et al.、「」を参照してください。大規模言語モデルの事実性: 調査、「自然言語処理における経験的手法に関する 2024 年会議議事録」(マイアミ: 計算言語学協会、2024 年 11 月 12 ~ 16 日)、19519 ~ 19529。
4. いくつか例を挙げると、非決定的な GPU 操作、浮動小数点の丸めの違い、バックエンドのサイレント更新などがあります。
#LLM #仕事 #トップ #エグゼクティブレベル #質問

