Телеграм Чат
ИИ ускоряет рост данных: 74% организаций ждут +25% за три года — исследование IDC


По мере перехода искусственного интеллекта от экспериментальных проектов к промышленному применению организации сталкиваются с постоянно увеличивающимся объёмом данных. В отличие от вычислительных операций, которые завершаются после выполнения задачи, данные могут продолжать накапливаться годами. Компаниям необходимо хранить исходные наборы данных, результаты обучения, контрольные точки моделей, журналы работы, резервные копии и архивы. В новом исследовании IDC, подготовленном при поддержке Western Digital, приводятся тревожные показатели масштаба этого роста.

Дата публикации: 28 сентября 2026 года  |  Источник: IDC, при поддержке Western Digital

Ключевые цифры исследования

Рост данных за год
61%
организаций: +25% и более
Прогноз на 3 года
74%
ожидают +25% и более
Рост Data Lake
85,4%
отметили увеличение объёма
Главный вызов
Баланс
Производительность / ёмкость / цена

Почему ИИ создаёт принципиально новую нагрузку на хранилища

Традиционные ИТ-нагрузки, как правило, имеют дело с циклическими процессами: данные обрабатываются, результат фиксируется, а исходные массивы могут быть удалены или заархивированы. ИИ ломает эту логику. Компаниям приходится сохранять:

  • исходные наборы данных — для повторного обучения и валидации моделей;
  • результаты обучения — промежуточные и финальные веса моделей;
  • контрольные точки (checkpoints) — снимки состояния модели на разных этапах;
  • журналы работы — данные о запуске, ошибках и метриках;
  • резервные копии и архивы — для соблюдения нормативных требований и воспроизводимости.

Всё это накапливается годами и требует постоянного доступа, что радикально меняет требования к инфраструктуре хранения.

Данные исследования IDC

Показатель Значение Период Комментарий
Организации с ростом данных на 25%+ 61% За последние 12 месяцев Причина — внедрение ИИ
Ожидают рост на 25%+ 74% В течение 3 лет Прогноз респондентов
Рост объёмов Data Lake 85,4% За предыдущий год Самая высокая доля
Ключевая задача Баланс Постоянно Производительность, ёмкость, энергопотребление, стоимость

Источник: IDC, исследование при поддержке Western Digital (сентябрь 2026).

Прогноз роста объёма данных в организациях

По данным IDC, рост объёма данных ускоряется: если в 2024 году 45% организаций отмечали рост на 25%+, то к 2029 году таких будет уже 80%+.

Что это означает для инфраструктуры хранения

Western Digital подчёркивает, что для масштабирования ИИ необходим баланс между производительностью, ёмкостью, энергопотреблением и стоимостью хранения. Универсального решения нет — нужна многоуровневая архитектура.

Тип данных Оптимальный носитель Обоснование
Горячие данные, активные рабочие наборы NVMe SSD Максимальная скорость, низкая задержка для обучения и инференса
Тёплые данные, часто используемые датасеты SATA/SAS SSD Баланс скорости и стоимости для регулярного доступа
Исходные данные, архивы, резервные копии HDD Максимальная ёмкость за минимальную стоимость на терабайт
Долгосрочное архивное хранение Ленточные библиотеки Минимальная стоимость для холодных данных, соответствует требованиям регуляторов

Несмотря на развитие SSD, жёсткие диски сохраняют значение для экономичного хранения больших объёмов данных. SSD могут использоваться для горячих данных и активных рабочих наборов, а HDD — для больших массивов исходных данных, архивов и резервных копий. Такое сочетание позволяет достичь оптимального баланса стоимости и производительности на каждом уровне.

Эволюция требований к хранению данных для ИИ

2023–2024
Экспериментальные ИИ-проекты, ограниченные наборы данных
2025–2026
Промышленное внедрение, рост Data Lake, первые проблемы с ёмкостью
2027–2028
Многоуровневые хранилища становятся стандартом для ИИ
2029+
80%+ организаций ожидают рост данных на 25%+ в год
⚠️ Что это означает для бизнеса и IT-специалистов.
Рост данных под влиянием ИИ — это не временное явление, а структурный сдвиг. Компаниям необходимо пересмотреть архитектуру хранения: где хранить горячие данные для обучения, где — контрольные точки моделей, а где — многолетние архивы. Универсального решения нет: оптимальная стратегия — многоуровневая архитектура с SSD для горячих данных и HDD для архивов. Western Digital и другие производители активно развивают обе линейки, подчёркивая, что баланс между производительностью, ёмкостью, энергопотреблением и стоимостью — ключевая задача на ближайшие годы.
ℹ️ Важное замечание. Приведённые показатели получены в исследовании, поддержанном производителем накопителей (Western Digital), и отражают ответы опрошенных организаций, а не универсальную статистику по всем компаниям. Данные следует рассматривать в контексте методологии исследования и выборки респондентов.

Часто задаваемые вопросы

▶ Почему ИИ приводит к такому резкому росту объёмов данных?
ИИ требует постоянного накопления данных: исходных наборов для повторного обучения, результатов обучения, контрольных точек моделей, журналов работы, резервных копий и архивов. В отличие от обычных вычислений, эти данные не удаляются после завершения задачи, а хранятся годами.
▶ Исчезнут ли HDD под натиском SSD?
Нет. Несмотря на развитие SSD, жёсткие диски сохраняют значение для экономичного хранения больших объёмов данных. SSD используются для горячих данных и активных рабочих наборов, а HDD — для больших массивов исходных данных, архивов и резервных копий. Оптимальная стратегия — сочетание обоих типов носителей.
▶ Насколько можно доверять этим цифрам?
Исследование проведено IDC, одной из наиболее авторитетных аналитических компаний, однако оно поддержано производителем накопителей (Western Digital). Это значит, что результаты отражают ответы опрошенных организаций и могут иметь определённый уклон. Тем не менее тренд на рост данных под влиянием ИИ подтверждается и другими независимыми исследованиями.
▶ Что такое Data Lake и почему он растёт быстрее всего?
Data Lake — это централизованное хранилище необработанных данных в исходном формате. Оно растёт быстрее всего (85,4% респондентов отметили увеличение), потому что ИИ-проекты требуют хранения всех исходных данных для повторного обучения, валидации и воспроизводимости результатов.
▶ Как сбалансировать производительность, ёмкость и стоимость?
Ключ — многоуровневая архитектура хранения: NVMe SSD для горячих данных (обучение, инференс), SATA/SAS SSD для тёплых данных, HDD для архивов и резервных копий, ленточные библиотеки для долгосрочного хранения. Каждый уровень оптимизирован по производительности, ёмкости, энергопотреблению и стоимости.
▶ Какие данные ИИ нужно хранить обязательно?
Обязательному хранению подлежат: исходные наборы данных (для повторного обучения), результаты обучения (веса моделей), контрольные точки (для воспроизводимости), журналы работы (для аудита), резервные копии и архивы (для соответствия нормативным требованиям).

0
0