Темы



ИИ-агенты не могут исправить сбои инфраструктуры, которые не способны диагностировать

Коротко сгенерировано ИИ по тексту статьи
  • 59% компаний в США и 53% в Великобритании не могут автоматически определить первопричину сбоя ИИ во всех доменах инфраструктуры.
  • Virtana предлагает объединять телеметрию и актуальную топологию всей ИИ-фабрики; её платформа Agentic Observability связывает данные об инфраструктуре, GPU и моделях.
  • В США 66% компаний эксплуатируют ИИ-инфраструктуру без надёжных базовых показателей производительности.

Почему это важно: Без полной картины зависимостей ИИ-агенты унаследуют слепые зоны операторов и могут усугубить сбои.

Представлено Virtana

Сбои инфраструктуры ИИ сложно диагностировать, потому что неисправность в одной системе вызывает симптомы сразу в нескольких других. Когда обучение модели замедляется, на панели мониторинга GPU может отображаться конкуренция за ресурсы, в отчёте о конвейере данных — остановка, а система хранения начинает выдавать предупреждения об ошибках ввода-вывода. При этом каждое предупреждение указывает на своё решение. Команды инфраструктуры видят все сигналы и часами пытаются выяснить, с чего начался сбой, пока дорогостоящие мощности GPU простаивают.

По мере того как компании создают фабрики ИИ, объединяющие GPU, системы хранения, сети, конвейеры данных и гибридные среды, разобраться в причинах становится ещё сложнее: мониторинг большинства фабрик ИИ по-прежнему опирается на отдельный инструмент для каждого направления. Кроме того, согласно опросам Virtana AI Factory Reality Check среди руководителей американских и британских компаний, принимающих решения, 59% компаний в США и 53% компаний в Великобритании не могут автоматически определить первопричину сбоя рабочей нагрузки ИИ во всех доменах инфраструктуры.

«Установив причинно-следственную связь, вы сможете устранить проблему, — говорит Пол Эпплби, президент и генеральный директор Virtana. — Если же установить её не удаётся, вы просто бросаете дротик в стену, пытаясь понять, что произошло и как это исправить».

Из-за масштабов ИИ-сбоев их сложнее отследить

Советы директоров требуют от компаний демонстрировать прогресс в области ИИ за счёт развёрнутой инфраструктуры, поэтому многие сначала строят её, а затем — если вообще доходят до этого — оснащают средствами мониторинга. Устаревшие инструменты, на которые приходится большая часть такого мониторинга, рассчитаны на стабильные, ограниченные системы с предсказуемой топологией сервисов. Но на фабрике ИИ планировщики постоянно перемещают рабочие нагрузки между гибридными средами, а потребление ресурсов нелинейно и резко меняется.

Для оповещений на основе пороговых значений нужна базовая линия нормальной производительности, с которой можно сравнивать текущие показатели. При этом 66% компаний в США эксплуатируют инфраструктуру ИИ без надёжных базовых показателей производительности. Лишь 34% компаний в США и 26% в Великобритании считают производительность рабочих нагрузок ИИ в высокой степени предсказуемой; среди американских организаций с числом сотрудников более 50 000 этот показатель падает до 25%. В итоге компании, эксплуатирующие крупнейшие фабрики ИИ, хуже всех способны предугадать, как те поведут себя дальше.

Чтобы сдерживать расходы на дорогостоящее оборудование для ИИ, многие компании в обеих странах перераспределяют рабочие нагрузки между гибридными средами и консолидируют системы, повышая эффективность использования ресурсов, — и всё это на работающих под нагрузкой системах. Каждое из этих изменений влияет на зависимости и конкуренцию за ресурсы во всём технологическом стеке.

«Без наблюдаемости на уровне системы организации не могут определить, как эти изменения влияют на результаты, затраты или надёжность, — говорит Эпплби. — Они постоянно оптимизируют системы ИИ, которых не понимают в полной мере, и при каждом изменении создают новые риски».

Для поиска первопричины нужна модель всей фабрики ИИ

При анализе первопричин необходимо установить, в какой части распределённой системы возникло оповещение. На фабрике ИИ для этого нужно одновременно проверять GPU, CPU, память, системы хранения, сети, оркестрацию и конвейеры данных.

В Великобритании автоматическое обнаружение сбоев распространено гораздо шире, чем автоматическая диагностика. Семьдесят пять процентов компаний используют автоматические оповещения как первую реакцию на сбой рабочей нагрузки ИИ, тогда как 47% могут автоматически выявить первопричину во всех доменах инфраструктуры. Остальные видят только один домен, вручную сопоставляют сигналы из разных инструментов или на несколько часов либо дней собирают вместе несколько команд. В США 25% компаний начинают реагировать на инцидент с ручного расследования в разрозненных консолях.

«Узкое место в системе хранения снижает производительность конвейера данных, из-за чего останавливается обучение модели и возникает конкуренция за ресурсы GPU, — говорит Эпплби. — Устаревшие инструменты мониторинга регистрируют три отдельных события в трёх разных доменах. Каждое из них технически описано верно, но ни одно не показывает, что произошло на самом деле».

Добавление инструментов мониторинга в каждый домен не устраняет разрозненность этих трёх событий. Фабрикам ИИ нужна единая операционная модель всей системы выполнения ИИ, которая в реальном времени сопоставляет непрерывные высокоточные телеметрические данные из каждого домена, включая оркестрацию и поведение приложений. Эта модель также должна поддерживать актуальную топологию взаимозависимостей рабочих нагрузок, сервисов и инфраструктуры, чтобы можно было отследить причину конкуренции за ресурсы GPU до узкого места в системе хранения. Топология меняется каждый раз, когда планировщик перемещает рабочую нагрузку, поэтому модель необходимо постоянно обновлять.

Руководители компаний в обеих странах поставили на первое место единое представление об ИИ и инфраструктуре, а на второе — анализ первопричин с помощью ИИ без необходимости вручную сопоставлять данные. Эти варианты лидировали во всех группах должностей и категориях выручки. Рынок наблюдаемости уже оценивается в миллиарды долларов, однако дополнительные специализированные инструменты мониторинга не решают выявленные в исследовании проблемы с видимостью и установлением причинно-следственных связей между доменами.

Прежде чем устранять сбои, ИИ-агентам нужно установить причинно-следственную связь

Крупным фабрикам ИИ потребуется автономное устранение сбоев, поскольку пропускная способность и сложность таких сред уже превышают возможности надёжной координации вручную. Лишь 23% британских специалистов по инфраструктуре и обеспечению надёжности сайтов (SRE), ежедневно работающих с нагрузками ИИ, считают их производительность в высокой степени предсказуемой. Прежде чем запускать агентов для работы с такими системами, компаниям необходимо внедрить телеметрию и модель актуальной топологии, объясняет Эпплби.

«Без этой основы ИИ-агенты унаследуют те же слепые зоны, которые ограничивают операторов-людей, и будут усугублять сбои с машинной скоростью, — говорит он. — Агент, действующий без полного контекста системы, не устраняет инциденты быстрее, а создаёт новые».

Virtana реализует этот подход с помощью платформы Agentic Observability. Она поддерживает общую модель всего стека выполнения ИИ в локальных, виртуализированных и общедоступных облачных средах. Автономные агенты в реальном времени сопоставляют данные об использовании GPU, спросе на токены, поведении моделей и производительности базовой инфраструктуры, а каждое выявление первопричины подтверждают доказательствами.

Распределение затрат и журналы аудита опираются на одну и ту же телеметрию

В обеих странах 31% компаний называют более чёткие показатели окупаемости уже сделанных инвестиций в ИИ важнейшим условием для дальнейшего масштабирования.

«Организации, которые не могут измерить использование GPU, стоимость каждой рабочей нагрузки и эффективность на уровне инфраструктуры, не смогут обосновать дальнейшие инвестиции, — говорит Эпплби. — Они могут наблюдать за расходами, но не могут управлять ими».

Руководители и инженеры, отвечающие за инфраструктуру ИИ, также по-разному оценивают способность своих организаций диагностировать сбои. В Великобритании 59% руководителей утверждают, что их организация автоматически определяет первопричину во всех доменах инфраструктуры. Среди инженеров по инфраструктуре и SRE, обрабатывающих оповещения, таких ответов лишь 34% — разрыв оказался больше, чем в опросе в США. ИТ-руководители, за которыми в большинстве британских организаций остаётся последнее слово при принятии решений об инвестициях в ИИ, увереннее всех оценивают возможности диагностики. Это проблема управления: люди, утверждающие бюджеты на ИИ, опираются на оценку готовности к диагностике, с которой не согласны их собственные инженеры.

Британские компании также внедряют ИИ в соответствии с британским GDPR и отраслевыми требованиями в финансовом секторе, здравоохранении и сфере критически важной национальной инфраструктуры. Эти нормы требуют вести журналы аудита и учитывать затраты. Тем не менее 39% британских компаний отодвигают проверки безопасности и соответствия требованиям на второй план по мере роста потребностей фабрик ИИ. По его словам, за пределами США суверенитет станет более значимой темой в области ИИ: страны и граждане будут добиваться контроля над собственным будущим.

«Система, которая доказывает работоспособность фабрики ИИ, — та же система, которая позволяет отчитаться перед регулирующим органом, аудитором или советом директоров, — говорит Эпплби. — Заявление о суверенитете без наблюдаемости ничем нельзя подтвердить».

Фабрики корпоративного ИИ развиты меньше, чем можно судить по объёму инвестиций

В публичном дискурсе компании из списка Global 2000 внедряют ИИ в огромных масштабах, однако большая часть крупнейших инвестиций в инфраструктуру ИИ приходится на гиперскейлеров и облачные платформы, говорит Эпплби.

«Всё это находится на более ранней стадии, чем можно было бы предположить по объёму инвестиций, — говорит он. — Во всём мире немного примеров крупных компаний, которые создали, масштабировали и развернули промышленные ИИ-сервисы и эффективно ими управляют».

Но если компания наращивает мощности, не обеспечив предварительно прозрачность и контроль, она лишь создаёт более масштабную и дорогую версию уже существующих у неё операционных проблем.

«Золотая лихорадка охватила крупнейших поставщиков сервисов, — говорит он. — У крупных компаний всё ещё есть возможность сделать всё правильно».

Спонсируемые статьи — это материалы, созданные компанией, которая оплачивает публикацию или состоит с VentureBeat в деловых отношениях. Такие материалы всегда имеют соответствующую пометку. За дополнительной информацией обращайтесь по адресу sales@venturebeat.com.

Полный текст статьи читайте на VentureBeat.ru