Телеграм Чат
d-Matrix Raptor + NVIDIA NVLink Fusion: что изменится в AI-серверах в 2027

d-Matrix Raptor подключается к NVIDIA NVLink Fusion: что это меняет в AI-серверах

d-Matrix объявила о сотрудничестве с NVIDIA: следующее поколение её inference-ускорителей Raptor будет интегрироваться в стоечную инфраструктуру NVIDIA через NVLink Fusion и платформу MGX. Первые интегрированные системы заявлены на IV квартал 2027 года. Ниже — что подтверждено уже сейчас, какие цифры относятся именно к заявлениям d-Matrix и почему Raptor не стоит воспринимать как универсальную замену GPU.

Ключевые факты

Срок
Q4 2027
заявленный срок первых интегрированных систем
Bandwidth
100 ТБ/с+
заявленная пропускная способность Raptor в раннем кремнии
3D-DRAM
32 ГБ
на одну Raptor-карту
Техпроцесс
4 нм
compute-die, представленный для Raptor
Коротко: главная новость не в том, что NVIDIA выпускает ещё один ускоритель. Важнее то, что сторонний XPU получает путь в NVIDIA rack-scale экосистему. Для d-Matrix это сокращает барьеры при масштабировании, а для заказчиков потенциально увеличивает выбор специализированного железа для inference.

Что произошло

d-Matrix сообщила, что будет использовать NVIDIA NVLink Fusion для подключения следующего поколения Raptor XPUs к инфраструктуре NVIDIA. Речь идёт о многоэтапной продуктовой дорожной карте, а не о уже доступном серийном сервере. NVIDIA отдельно подтвердила интеграцию Raptor в свою AI-инфраструктуру.

Будущая конфигурация рассчитана прежде всего на AI inference — выполнение уже обученных моделей. Целевые сценарии включают чат-ботов, coding assistants, голосовых агентов и другие приложения, где важны задержка выдачи токенов, пропускная способность и энергопотребление.

Важно: партнёрство не означает, что Raptor уже стал частью серийных GPU NVIDIA. Это план интеграции специализированного XPU в NVIDIA MGX/NVLink Fusion. Первые системы заявлены на Q4 2027.

Почему NVIDIA NVLink Fusion здесь важнее самого названия Raptor

NVLink Fusion позволяет сторонним разработчикам специализированных ускорителей использовать элементы rack-scale инфраструктуры NVIDIA. В случае d-Matrix это означает интеграцию Raptor с NVLink, MGX и сетевыми компонентами платформы NVIDIA, вместо создания полностью собственной стоечной архитектуры.

КомпонентРоль в интеграции
Raptor XPUСпециализированный inference-ускоритель d-Matrix
NVLink FusionСвязь XPU с NVIDIA rack-scale платформой
NVLink / MGXМасштабирование и стоечная архитектура
Vera + BlueField-4 + ConnectX-9Компоненты заявленной инфраструктуры

Упрощённая схема. Она показывает архитектурную роль компонентов, а не окончательную конфигурацию серийного сервера.

Что такое Raptor и зачем ему 3D-DRAM

Raptor — второе поколение inference-архитектуры d-Matrix после Corsair. Ключевая идея — разместить вычислительную логику непосредственно над специально разработанной DRAM и сократить путь передачи данных между памятью и вычислителем.

Для inference это особенно важно в decode-фазе: модель генерирует токены последовательно, поэтому ускоритель постоянно читает большие объёмы весов модели и KV-cache. В такой ситуации узким местом может стать не количество вычислительных блоков, а скорость доставки данных из памяти.

d-Matrix заявляет для представленного Raptor более 100 ТБ/с пропускной способности памяти на карту и около 0,37 пДж/бит для передачи данных через вертикальный интерфейс. При этом ёмкость одной карты составляет 32 ГБ. Эти цифры следует воспринимать как характеристики и расчёты производителя для раннего кремния, а не как независимый отраслевой benchmark.

Главный компромисс Raptor: огромная пропускная способность против ёмкости

Сильная сторонаОграничение
  • очень короткий путь между DRAM и вычислительной логикой;
  • заявленная пропускная способность свыше 100 ТБ/с на карту;
  • архитектура специально ориентирована на generative AI inference;
  • высокая локальная bandwidth особенно интересна для decode.
  • 32 ГБ памяти на карту — мало для многих современных крупных моделей;
  • масштабирование требует нескольких карт и быстрой межсоединительной сети;
  • серийные поставки и цена Raptor ещё не подтверждены;
  • производительность в реальных коммерческих системах ещё предстоит проверить.

Raptor против обычного GPU: где проходит граница

ЗадачаGPURaptor / XPUПрактический смысл
Обучение моделиСильная сторона GPUНе основная цельRaptor не позиционируется как замена GPU для training.
PrefillВысокая вычислительная эффективностьНе главный фокусВ гибридной системе GPU может выполнять вычислительно тяжёлую часть.
DecodeУниверсальный вариантОсновной сценарийRaptor нацелен на memory-bound часть inference.
Низкая задержкаВысокая, но зависит от модели и конфигурацииПриоритет архитектурыОсобенно важно для интерактивных AI-сервисов.
Гибридная инфраструктураМожет быть частью системыПроектируется для совместной работыНаиболее реалистичный сценарий — не «GPU или Raptor», а специализированный pipeline.

Две ключевые характеристики Raptor

Эти показатели полезнее абстрактных прогнозов рынка: они сразу показывают сильную сторону архитектуры и её практическое ограничение.

Memory bandwidth
100 ТБ/с+
Память на карту
32 ГБ

Шкалы намеренно не объединяются в один числовой рейтинг: ТБ/с и ГБ измеряют разные параметры. Визуализация показывает, какие характеристики нужно оценивать одновременно.

Самая полезная цифра — не «100 ТБ/с», а 32 ГБ

В новостях легко сфокусироваться на рекордной bandwidth. Для практического сравнения инфраструктуры важнее одновременно смотреть на пропускную способность, ёмкость памяти, масштабирование, задержку, энергопотребление и стоимость всей системы.

У Raptor заявленная локальная bandwidth очень высокая, но 32 ГБ на карту означают, что крупные модели нельзя рассматривать только в пределах одной карты. Их нужно распределять между ускорителями. Тогда преимущество локальной памяти должно компенсировать дополнительные расходы на обмен данными между картами.

Вывод для покупателя инфраструктуры: пока рано делать вывод «Raptor быстрее любого GPU». Корректный вопрос другой: насколько Raptor улучшит стоимость и задержку decode конкретной модели при заданном размере batch, контексте, числе пользователей и конфигурации стойки.

Что известно о производительности — и чего пока не известно

ПоказательЧто заявленоСтатус
Memory bandwidth>100 ТБ/с на картуРанний кремний / данные d-Matrix
Память32 ГБ 3D-DRAM на картуПредставленная архитектура
Энергия передачи данныхоколо 0,37 пДж/битИзмерение, представленное d-Matrix
Inference throughputесть модельные сравнения с HBM-конфигурациямиНе считать универсальным benchmark
Цена и TCOне раскрытыПока неизвестно
Массовая доступностьожидается Q4 2027 для интегрированных системПлан / roadmap

Почему это важно для NVIDIA

Для NVIDIA это продолжение стратегии, в которой компания превращает NVLink и rack-scale инфраструктуру в платформу, способную работать не только с собственными вычислительными ядрами. NVLink Fusion был представлен NVIDIA именно как способ интеграции специализированного compute с её масштабируемой AI-инфраструктурой.

Для рынка это потенциально важнее одного продукта d-Matrix: гиперскейлеры получают больше возможностей для создания гетерогенных AI-стоек, где разные ускорители выполняют разные этапы нагрузки. Такая архитектура снижает зависимость от универсального ускорителя, если специализированный XPU даёт лучший показатель latency, tokens/s/W или TCO для конкретной задачи.

Дорожная карта: что уже произошло и чего ждать

Август 2026
Raptor был подробно представлен на Hot Chips 2026 как 3D-DRAM accelerator.
10.09.2026
d-Matrix и NVIDIA объявили интеграцию Raptor через NVLink Fusion.
До конца 2026
d-Matrix ожидает tape-out Raptor.
Q4 2027
Заявлена доступность первых интегрированных rack-scale систем.

Что это означает для рынка AI-серверов

Сценарий «один универсальный ускоритель для всего» постепенно уступает место гетерогенным вычислительным системам. GPU остаются важными для обучения и вычислительно тяжёлых этапов inference, а специализированные XPU могут брать на себя memory-bound или latency-sensitive части pipeline.

При этом Raptor пока следует рассматривать как перспективную специализированную платформу, а не как доказанную замену NVIDIA GPU. Ключевыми точками проверки в 2027 году станут реальные latency и throughput, масштабирование между картами, цена системы, энергопотребление, доступность памяти и стабильность программного стека.

Итог

Главная мысль: d-Matrix пытается решить проблему AI inference не увеличением числа универсальных вычислительных блоков, а радикальным сокращением расстояния между вычислениями и памятью. NVIDIA NVLink Fusion даёт этой архитектуре путь в готовую rack-scale экосистему. Если заявленные характеристики и экономика подтвердятся в серийных системах, это может ускорить переход к гетерогенным AI-стойкам. Но сегодня это ещё roadmap на 2027 год, а не готовая альтернатива GPU.

Частые вопросы

▶ Что такое NVIDIA NVLink Fusion?
Это платформа NVIDIA для интеграции специализированных сторонних compute-решений в rack-scale инфраструктуру с использованием NVLink и связанных технологий. В случае d-Matrix она предназначена для подключения Raptor XPU к экосистеме NVIDIA.
▶ Raptor заменит NVIDIA GPU?
Нет оснований так утверждать. Raptor проектируется прежде всего для AI inference и особенно для memory-bound decode. Более реалистичный сценарий — совместная работа специализированного XPU с GPU и другими компонентами системы.
▶ Когда появятся первые системы с Raptor?
d-Matrix и NVIDIA заявили о первых интегрированных системах в четвертом квартале 2027 года. Это планируемый срок, а не подтверждённая дата массовых поставок.
▶ Сколько памяти у Raptor?
Для представленной Raptor-карты заявлено 32 ГБ 3D-DRAM. Это существенно меньше, чем суммарная память у многих современных GPU-конфигураций, поэтому масштабирование между несколькими картами остаётся важной частью архитектуры.
▶ Правда ли, что Raptor работает в 10 раз быстрее GPU?
Так формулировать новость некорректно. Заявления d-Matrix о 10-кратном ускорении относятся к отдельным гибридным inference-сценариям с Corsair и GPU. Для Raptor опубликованные цифры следует рассматривать как архитектурные и модельные сравнения, а не как универсальный показатель «10× быстрее любого GPU».

0
0