Компания Cerebras, известная своими гигантскими «тарелками-процессорами», официально представила AI-компьютер CS-4. Производитель утверждает, что это новый король в задачах вывода ИИ-моделей (инференса). Система обеспечивает скорость генерации токенов для модели GPT-OSS-120B — более 4400 токенов в секунду на одного пользователя, что в 30 раз быстрее, чем у классических GPU-серверов Nvidia в режиме одного пользователя. Устройство уже тестируется у ограниченного круга клиентов, а широкий релиз намечен на конец третьего квартала 2026 года.
Ключевые характеристики Cerebras CS-4
Скорость инференса
4 400+ токенов/с
GPT-OSS-120B, на одного пользователя
Преимущество
в 30 раз быстрее
Процессор
3 × WSE-3 Turbo
Каждый размером с обеденную тарелку
Транзисторы
4 триллиона
900 000 ядер на кристалле
Частота
2,8 ГГц
Против 1,4 ГГц у предшественника
Пиковая производительность
250 PFLOPs
Для AI-задач
Встроенная SRAM
44 ГБ
Прямо на чипе
Пропускная способность
43,2 ПБ/с
В 1000 раз выше, чем у топовых GPU
Что такое Cerebras CS-4 и почему это прорыв
Cerebras CS-4 — это не просто очередной сервер, а полностью переосмысленная архитектура для ИИ-вычислений. Вместо того чтобы использовать сотни GPU, соединённых медленными межсоединениями, Cerebras создала систему, где весь вес модели размещается на одном кристалле — точнее, на трёх кристаллах WSE-3 Turbo, каждый из которых по площади сравним с обеденной тарелкой.
Главная фишка CS-4 — 44 ГБ сверхбыстрой SRAM, расположенной прямо на чипе. Пропускная способность этой памяти составляет 43,2 ПБ/с — это в 1000 раз выше, чем у топовых GPU от Nvidia или AMD. Благодаря этому CS-4 практически не тратит время на пересылку данных между памятью и вычислительными ядрами, что кардинально ускоряет инференс.
Суммарно система содержит 4 триллиона транзисторов и 900 000 ядер на кристалле. Частота работы увеличена до 2,8 ГГц (против 1,4 ГГц у предшественника), а пиковая производительность для AI-задач достигает 250 PFLOPs.
Сравнение Cerebras CS-4 с GPU-серверами Nvidia
| Характеристика |
Cerebras CS-4 |
Nvidia GPU-сервер (8 × H100) |
| Скорость инференса (GPT-OSS-120B) |
4 400+ токенов/с |
~147 токенов/с |
| Преимущество в скорости |
в 30 раз быстрее |
база |
| Память на чипе |
44 ГБ SRAM |
нет (внешняя HBM) |
| Пропускная способность памяти |
43,2 ПБ/с |
~3,35 ТБ/с (HBM3) |
| Преимущество по пропускной способности |
в 1000 раз выше |
база |
| Транзисторы |
4 трлн |
~80 млрд (на GPU) |
Источник: пресс-релиз Cerebras, август 2026.
Сравнение скорости генерации токенов
Источник: данные Cerebras. CS-4 обеспечивает скорость генерации токенов в 30 раз выше, чем GPU-серверы Nvidia.
Дорожная карта Cerebras CS-4
Август 2026
Официальный анонс CS-4
Август 2026
Начало тестирования у ограниченного круга клиентов
Конец Q3 2026
Широкий релиз CS-4
2027+
Планируется развитие платформы и новые модели
⚠️
Что это означает для ИИ-инфраструктуры.
Cerebras CS-4 демонстрирует, что альтернативные архитектуры могут кардинально превосходить традиционные GPU-решения в задачах инференса. Скорость 4400 токенов в секунду открывает новые возможности для реального времени: от чат-ботов с мгновенным ответом до сложных агентных систем, где задержка является критическим фактором. Однако остаётся открытым вопрос цены, энергопотребления и совместимости с существующими экосистемами. Тем не менее, появление CS-4 — это серьёзный вызов для
Nvidia и
AMD в сегменте инференса.
Часто задаваемые вопросы
▶ Что такое WSE-3 Turbo?
WSE-3 Turbo — это гигантский процессор Cerebras, размером с обеденную тарелку. В CS-4 используются три таких кристалла, каждый из которых содержит миллионы ядер и десятки гигабайт встроенной SRAM-памяти.
▶ Почему CS-4 такой быстрый при инференсе?
Главная причина — 44 ГБ SRAM прямо на чипе с пропускной способностью 43,2 ПБ/с. Это в 1000 раз быстрее, чем у GPU с внешней памятью HBM, что практически устраняет задержки на пересылку данных между памятью и ядрами.
▶ Какие модели ИИ можно запускать на CS-4?
Cerebras демонстрировала работу с моделью GPT-OSS-120B. Благодаря большому объёму встроенной памяти, CS-4 способен размещать модели с сотнями миллиардов параметров целиком на кристалле, без необходимости распределения по множеству устройств.
▶ Когда CS-4 станет доступен широкому рынку?
На данный момент CS-4 тестируется у ограниченного круга клиентов. Широкий релиз запланирован на конец третьего квартала 2026 года.
▶ Стоит ли ждать CS-4 вместо покупки GPU-серверов?
Это зависит от задач. Для инференса больших моделей с требованием к низкой задержке CS-4 выглядит крайне привлекательно. Однако для обучения моделей или задач, требующих гибкости экосистемы Nvidia, GPU-решения пока остаются стандартом. Окончательный выбор будет зависеть от цены, доступности и совместимости с существующими фреймворками.