Телеграм Чат
Cerebras CS-4: в 30 раз быстрее GPU-серверов Nvidia при инференсе ИИ

Компания Cerebras, известная своими гигантскими «тарелками-процессорами», официально представила AI-компьютер CS-4. Производитель утверждает, что это новый король в задачах вывода ИИ-моделей (инференса). Система обеспечивает скорость генерации токенов для модели GPT-OSS-120Bболее 4400 токенов в секунду на одного пользователя, что в 30 раз быстрее, чем у классических GPU-серверов Nvidia в режиме одного пользователя. Устройство уже тестируется у ограниченного круга клиентов, а широкий релиз намечен на конец третьего квартала 2026 года.

Ключевые характеристики Cerebras CS-4

Скорость инференса
4 400+ токенов/с
GPT-OSS-120B, на одного пользователя
Преимущество
в 30 раз быстрее
Чем GPU-серверы Nvidia
Процессор
3 × WSE-3 Turbo
Каждый размером с обеденную тарелку
Транзисторы
4 триллиона
900 000 ядер на кристалле
Частота
2,8 ГГц
Против 1,4 ГГц у предшественника
Пиковая производительность
250 PFLOPs
Для AI-задач
Встроенная SRAM
44 ГБ
Прямо на чипе
Пропускная способность
43,2 ПБ/с
В 1000 раз выше, чем у топовых GPU

Что такое Cerebras CS-4 и почему это прорыв

Cerebras CS-4 — это не просто очередной сервер, а полностью переосмысленная архитектура для ИИ-вычислений. Вместо того чтобы использовать сотни GPU, соединённых медленными межсоединениями, Cerebras создала систему, где весь вес модели размещается на одном кристалле — точнее, на трёх кристаллах WSE-3 Turbo, каждый из которых по площади сравним с обеденной тарелкой.

Главная фишка CS-4 — 44 ГБ сверхбыстрой SRAM, расположенной прямо на чипе. Пропускная способность этой памяти составляет 43,2 ПБ/с — это в 1000 раз выше, чем у топовых GPU от Nvidia или AMD. Благодаря этому CS-4 практически не тратит время на пересылку данных между памятью и вычислительными ядрами, что кардинально ускоряет инференс.

Суммарно система содержит 4 триллиона транзисторов и 900 000 ядер на кристалле. Частота работы увеличена до 2,8 ГГц (против 1,4 ГГц у предшественника), а пиковая производительность для AI-задач достигает 250 PFLOPs.

Сравнение Cerebras CS-4 с GPU-серверами Nvidia

Характеристика Cerebras CS-4 Nvidia GPU-сервер (8 × H100)
Скорость инференса (GPT-OSS-120B) 4 400+ токенов/с ~147 токенов/с
Преимущество в скорости в 30 раз быстрее база
Память на чипе 44 ГБ SRAM нет (внешняя HBM)
Пропускная способность памяти 43,2 ПБ/с ~3,35 ТБ/с (HBM3)
Преимущество по пропускной способности в 1000 раз выше база
Транзисторы 4 трлн ~80 млрд (на GPU)

Источник: пресс-релиз Cerebras, август 2026.

Сравнение скорости генерации токенов

Источник: данные Cerebras. CS-4 обеспечивает скорость генерации токенов в 30 раз выше, чем GPU-серверы Nvidia.

Дорожная карта Cerebras CS-4

Август 2026
Официальный анонс CS-4
Август 2026
Начало тестирования у ограниченного круга клиентов
Конец Q3 2026
Широкий релиз CS-4
2027+
Планируется развитие платформы и новые модели
⚠️ Что это означает для ИИ-инфраструктуры. Cerebras CS-4 демонстрирует, что альтернативные архитектуры могут кардинально превосходить традиционные GPU-решения в задачах инференса. Скорость 4400 токенов в секунду открывает новые возможности для реального времени: от чат-ботов с мгновенным ответом до сложных агентных систем, где задержка является критическим фактором. Однако остаётся открытым вопрос цены, энергопотребления и совместимости с существующими экосистемами. Тем не менее, появление CS-4 — это серьёзный вызов для Nvidia и AMD в сегменте инференса.

Часто задаваемые вопросы

▶ Что такое WSE-3 Turbo?
WSE-3 Turbo — это гигантский процессор Cerebras, размером с обеденную тарелку. В CS-4 используются три таких кристалла, каждый из которых содержит миллионы ядер и десятки гигабайт встроенной SRAM-памяти.
▶ Почему CS-4 такой быстрый при инференсе?
Главная причина — 44 ГБ SRAM прямо на чипе с пропускной способностью 43,2 ПБ/с. Это в 1000 раз быстрее, чем у GPU с внешней памятью HBM, что практически устраняет задержки на пересылку данных между памятью и ядрами.
▶ Какие модели ИИ можно запускать на CS-4?
Cerebras демонстрировала работу с моделью GPT-OSS-120B. Благодаря большому объёму встроенной памяти, CS-4 способен размещать модели с сотнями миллиардов параметров целиком на кристалле, без необходимости распределения по множеству устройств.
▶ Когда CS-4 станет доступен широкому рынку?
На данный момент CS-4 тестируется у ограниченного круга клиентов. Широкий релиз запланирован на конец третьего квартала 2026 года.
▶ Стоит ли ждать CS-4 вместо покупки GPU-серверов?
Это зависит от задач. Для инференса больших моделей с требованием к низкой задержке CS-4 выглядит крайне привлекательно. Однако для обучения моделей или задач, требующих гибкости экосистемы Nvidia, GPU-решения пока остаются стандартом. Окончательный выбор будет зависеть от цены, доступности и совместимости с существующими фреймворками.

0
0