
エンタープライズAIツールに短いプロンプトを入力するたびに、画面上で見える点滅するインジケーターの背後で、インフラストラクチャ内で無数の目に見えないメカニズムとプロセスが作動します。ツールがエンタープライズポリシー、セッション履歴、取得したドキュメント、および有用で信頼性の高い出力を生成するために必要なその他すべてのコンテキストデータを添付する際、入力した十数語の単語は体系的に40,000トークンのワークロードになります。
ここで、何千人ものユーザーとエージェントが同時にシステムにアクセスし、各プロンプトが企業の知識ベースにアクセスすることを考えてみてください。世界最大の企業では、その知識ベースは100ペタバイト(PB)に達する可能性があります。そのアーカイブからサービスを提供すると、2番目のアクティブストアであるキーバリュー(KV)キャッシュが生成されます。これは、データの量ではなく、同時にクエリを実行するユーザー数に応じてスケーリングします。
これらのトークンに対する高価な計算は、出力をボトルネックにする冗長性と非効率性を防ぐために、保存して再利用する価値のあるキャッシュになります。しかし、ツールがそれを実行できるのは、技術インフラストラクチャにそのキャッシュを保持する場所がある場合のみです。そして、多くの企業はAIインフラストラクチャを構築する際にこのストレージの必要性を考慮していません。スペースが不足するまでは。
エンタープライズAIツールがスケーリングできるようにするには、AI出力を生成するように設計された基盤が、それらの作成に必要な複雑な操作の計算を保存する能力と容量を持っている必要があります。
そして、従来のオプションはこの規模では不十分です。高速だが容量が限られているダイナミックランダムアクセスメモリ(DRAM)は、このデータを保持するには高価すぎ、ハードディスクドライブ(HDD)はサービスを提供するには遅すぎます。フリートレベルでエンタープライズAIを処理するには、大容量ソリッドステートドライブ(SSD)に依存します。これらは、データを保持する容量とサービスを提供する速度を提供し、AI投資のリターンを達成可能にするエネルギー効率とフットプリントを備えています。
AI推論の影響
企業が成長戦略にAIを適用するにつれて、その焦点の多くは、より大規模でより高性能なモデルのトレーニングと、強力なグラフィックスプロセッシングユニット(GPU)への投資に残っています。しかし、現在のより大きな課題は推論です。それは、正確かつ信頼性高く、迅速に大規模でAI応答を提供するプロセスです。
現代のAIシステムでは、すべてのプロンプトがポリシー指示、セッション履歴、取得したドキュメント、ツール出力、およびその他のコンテキストコンポーネントで構成されるバンドルを作成します。このバンドル全体がAIシステムに供給され、高価なGPUが計算を行います。これらの計算(KVキャッシュ)は再利用可能な資産となり、システムがそれらを何度も再計算する必要がなくなります。KVキャッシュはAIシステム内の「状態」を表し、AIの展開が成熟するにつれて、その状態の管理がパフォーマンスにとって重要になります。
企業が内部知識ベースに対する検索拡張生成(RAG)、エージェンティックワークフロー、および長文脈推論に依存するにつれて、ストレージの課題はさらに複雑になります。これらのそれぞれが、システムが一度に保存してアクセスしなければならない情報の量を増加させます。そして、その情報の多くはAIが応答する前に取得する必要があるため、ストレージの速度(容量だけでなく)が、システムを使用する人々にとっての応答の速さを形作ります。ユーザーが最初の応答を見る前の遅延は、最初のトークンまでの時間(TTFT)として知られています。
組織のリーダーは、より多くのGPU容量がより高速なAIを実現すると想定することがよくありますが、実際には、GPUやその他のアクセラレータは、AIシステムがドキュメントを取得したり、コンテキストをロードしたり、キャッシュされた計算を復元したり、データ移動やストレージのボトルネックを待機したりしている間、頻繁にアイドル状態になります。
計算は急速に拡大します。 単一の長文脈リクエストには、312ギガバイトのKVキャッシュが必要になる場合があります。それを8人の同時ユーザーに掛けると、要件は2.5テラバイト(TB)に跳ね上がります。エージェンティックワークフローを追加すると、その数は10TBに膨れ上がります。これらすべてを低レイテンシで保存、アクセス、管理する必要があります。
当初はセッションごとに管理可能なメモリ要件に見えたワークロードが、複数のユーザーが同時にAIと対話する場合、巨大な課題になります。それらの保存された計算は、インフラストラクチャリソースの最大の消費者の1つになります。
それが「隠れたストレージ税」です。AIシステムが大規模に本番稼働されたときにのみ明らかになる問題です。パイロットでは実行可能に見えたタスクでさえ、同時に実行されるユーザーまたはAIセッションの数が指数関数的に増加する(同時実行性として知られる)につれて、実際には持続不可能になります。結果として、応答の遅延、予期しないボトルネック、十分に活用されていないインフラストラクチャ、および運用コストの増加が発生します。
ストレージが重要な理由
歴史的に、組織はストレージを受動的なデータリポジトリ、つまり保存データの保管場所として扱ってきました。このアプローチは、主にバックアップシステム、アーカイブ、データベースにストレージを使用していたときに機能しました。しかし、AI環境では、SSDストレージはアプリケーションのアクティブな部分であり、応答性、スケーラビリティ、ユーザーエクスペリエンス、およびコスト効率にとって重要です。この変化にもかかわらず従来のベンチマーク指標を使い続ける企業は、スケーリングできないAI投資とAIパイロットの失敗のリスクを負っています。
これらの変化はまだ推論において現れつつありますが、根本的な原則はAIが大規模に実行される場所ならどこでもすでに見えています。システムが機能するかどうかを決定するのは、コンピューティングだけでなく、ストレージアーキテクチャです。
ソフトウェア定義ストレージプロバイダーであるPEAK:AIOは、磁気共鳴画像法(MRI)スキャンを分析して癌の兆候を特定するためにAIを使用する医療機関と協力しています。これらの機関は膨大な量の画像データを生成しますが、そのデータを効率的に保存、アクセス、分析するために必要なインフラストラクチャを欠いていることがよくあります。PEAK:AIOは顧客に大容量SSDを提供し、自社のシステムとネットワーク内で大規模データセットを保存および処理できるようにします。
ハイパフォーマンスコンピューティングおよびAIインフラストラクチャソリューションのプロバイダーであるDUG Technologyは、コンテナ化モジュラーデータセンター向けにSSDを使用して、産業現場、エネルギー施設、その他の遠隔地など、ストレージインフラストラクチャを展開する能力が限られている場所で顧客がAIシステムを実行できるようにしています。
初日からのAI決定
適切なストレージアーキテクチャは、長文脈推論、RAG、およびエージェンティックAIワークフロー向けに、応答性、インフラストラクチャ効率、およびスケーラビリティを向上させることができます。
企業がAIイニシアチブを拡大するにつれて、AIアーキテクト、調達および財務のリーダー、プラットフォームエンジニア、その他の意思決定者が、現在および今後数年間にわたって運用を処理しボトルネックを防ぐために、十分な大容量SSDストレージを備えた技術基盤を構築することがますます重要になっています。
そしてそれは、ストレージが最初から設計の議論の一部である必要があることを意味します。そうすることで、企業は後でインフラストラクチャを改造するための投資を避けることができます。
#隠れた #ストレージ #税 #会話

