
Каждый раз, когда вы вводите короткий запрос в корпоративный ИИ-инструмент, за этим мигающим индикатором на экране в инфраструктуре запускается множество невидимых механизмов и процессов. Когда инструмент присоединяет корпоративные политики, историю сессии, извлеченные документы и все другие контекстные данные, необходимые для генерации полезного и надежного результата, десяток введенных вами слов систематически превращается в рабочую нагрузку из 40 000 токенов.
Теперь представьте, что тысячи пользователей и агентов могут одновременно обращаться к системе, каждый запрос обращаясь к корпоративной базе знаний, которая в крупнейших мировых компаниях может достигать 100 петабайт (ПБ). Обслуживание из этого архива создает второй активный накопитель — кэш ключ-значение (KV-кэш), который масштабируется не в зависимости от объема данных, а от количества пользователей, одновременно запрашивающих его.
Дорогостоящие вычисления над этими токенами становятся кэшем, который стоит сохранять и повторно использовать, чтобы избежать избыточности и неэффективности, замедляющих вывод результатов. Но инструмент может сделать это только в том случае, если техническая инфраструктура имеет место для хранения этого кэша. И многие предприятия не учитывают необходимость такого хранилища при создании ИИ-инфраструктуры — пока у них не закончится место.
Чтобы корпоративные ИИ-инструменты могли масштабироваться, основы, предназначенные для генерации ИИ-результатов, должны иметь возможность и емкость для хранения вычислений сложных операций, необходимых для их создания.
И традиционные варианты не справляются с таким масштабом: быстрая, но ограниченная по емкости динамическая оперативная память (DRAM) слишком дорога для хранения этих данных, а жесткие диски (HDD) слишком медленны для их обслуживания. Обработка корпоративного ИИ на уровне флота зависит от твердотельных накопителей (SSD) большой емкости, которые обеспечивают емкость для хранения и скорость для обслуживания — с энергоэффективностью и занимаемым пространством, делающими возврат инвестиций в ИИ достижимым.
Влияние вывода ИИ
Поскольку предприятия все чаще применяют ИИ в своей стратегии роста, основное внимание по-прежнему уделяется обучению более крупных и мощных моделей и инвестициям в мощные графические процессоры (GPU). Но сейчас большей проблемой является вывод: процесс точного, надежного и быстрого предоставления ИИ-ответов в масштабе.
В современных ИИ-системах каждый запрос создает пакет, состоящий из инструкций политики, истории сессии, извлеченных документов, результатов инструментов и других контекстных компонентов. Весь этот пакет подается в ИИ-систему, где дорогие GPU выполняют вычисления. Эти вычисления — KV-кэш — становятся повторно используемыми активами, чтобы системе не приходилось пересчитывать их снова и снова. KV-кэш представляет собой «состояние» в ИИ-системе, и по мере развития ИИ-развертываний управление этим состоянием становится критически важным для производительности.
Проблема хранения данных только усугубляется, поскольку предприятия полагаются на генерацию с дополнением извлечением (RAG), агентные рабочие процессы и долгоконтекстное рассуждение на основе внутренних баз знаний. Каждый из этих факторов увеличивает объем информации, которую система должна хранить и одновременно получать доступ. И поскольку большая часть этой информации должна быть извлечена до того, как ИИ сможет ответить, скорость хранения, а не только емкость, определяет, насколько быстрой система кажется пользователям: задержка перед тем, как пользователь увидит первый ответ, известная как время до первого токена (TTFT).
Хотя руководители организаций часто предполагают, что большая мощность GPU обеспечивает более быстрый ИИ, в действительности GPU и другие ускорители часто простаивают, пока ИИ-системы извлекают документы, загружают контекст, восстанавливают кэшированные вычисления или ожидают перемещения данных и узких мест в хранилище.
Математика быстро масштабируется. Один долгоконтекстный запрос может потребовать 312 гигабайт KV-кэша. Умножьте это на восемь одновременных пользователей, и требование возрастет до 2,5 терабайт (ТБ). Добавьте агентные рабочие процессы, и цифра взлетит до 10 ТБ — все это необходимо хранить, получать доступ и управлять с низкой задержкой.
Рабочая нагрузка, которая изначально могла показаться управляемым требованием к памяти на сессию, становится огромной проблемой, когда несколько пользователей одновременно взаимодействуют с ИИ. Эти сохраненные вычисления становятся одними из крупнейших потребителей ресурсов инфраструктуры.
Это и есть «скрытый налог на хранение данных»: проблемы, которые становятся очевидными только тогда, когда ИИ-системы вводятся в эксплуатацию в масштабе. Даже задача, которая казалась выполнимой в пилотных проектах, становится неустойчивой на практике, поскольку количество пользователей или ИИ-сессий, работающих одновременно, увеличивается экспоненциально, что известно как параллелизм. Результат: более медленные ответы, непредвиденные узкие места, недоиспользуемая инфраструктура и более высокие эксплуатационные расходы.
Почему хранение данных критически важно
Исторически организации относились к хранилищу как к пассивному репозиторию для своих данных — месту для хранения данных в покое. Такой подход работал, когда они использовали хранилище в основном для систем резервного копирования, архивов и баз данных. Но в средах ИИ SSD-хранилище является активной частью приложений, критически важной для отзывчивости, масштабируемости, пользовательского опыта и экономической эффективности. Предприятия, которые продолжают использовать традиционные контрольные показатели, несмотря на этот сдвиг, рискуют тем, что их ИИ-инвестиции не смогут масштабироваться, и пилотные проекты ИИ провалятся.
Эти изменения все еще проявляются в выводе, но основной принцип уже виден везде, где ИИ работает в масштабе: архитектура хранения, а не только вычисления, определяет, будет ли система работать.
PEAK:AIO, поставщик программно-определяемых хранилищ, работает с медицинскими учреждениями, использующими ИИ для анализа снимков магнитно-резонансной томографии (МРТ) для выявления признаков рака. Эти учреждения генерируют огромные объемы данных изображений, но многим не хватает инфраструктуры для эффективного хранения, доступа и анализа этих данных. PEAK:AIO предлагает своим клиентам SSD большой емкости, чтобы они могли хранить и обрабатывать большие наборы данных в своих собственных системах и сетях.
Для своих контейнерных модульных центров обработки данных DUG Technology, поставщик решений для высокопроизводительных вычислений и ИИ-инфраструктуры, использует SSD, чтобы позволить своим клиентам запускать ИИ-системы в местах, где возможность развертывания инфраструктуры хранения ограничена, таких как промышленные объекты, энергетические объекты и другие удаленные районы.
Решение ИИ с нулевого дня
Правильная архитектура хранения может улучшить отзывчивость, эффективность инфраструктуры и масштабируемость для долгоконтекстного вывода, RAG и агентных ИИ-рабочих процессов.
По мере расширения ИИ-инициатив предприятиями становится все более критически важным для ИИ-архитекторов, а также руководителей в сфере закупок и финансов, платформенных инженеров и других лиц, принимающих решения, создавать технические основы с достаточным объемом SSD-хранилища большой емкости для обработки операций и предотвращения узких мест сегодня и в ближайшие годы.
И это означает, что хранение данных должно быть частью обсуждения дизайна с самого начала — чтобы их предприятия могли избежать необходимости инвестировать в модернизацию своей инфраструктуры в будущем.
#Скрытый #Налог #На #Хранилище #Разговор

