10 сентября 2026 года компания d-Matrix объявила об использовании технологии Nvidia NVLink Fusion для интеграции собственных ИИ-процессоров Raptor в системы Nvidia. Речь идёт прежде всего об ускорении inference — непосредственного выполнения уже обученной ИИ-модели. Это несколько отличается от обучения моделей: inference требует очень высокой скорости обработки запросов и низких задержек. Новая архитектура ориентирована на такие задачи, как чат-боты, AI coding assistants, голосовые агенты, автономные ИИ-системы и обработка запросов в реальном времени. Ожидается, что интегрированные системы появятся на рынке в 2027 году. Это ещё один показатель того, как меняется архитектура серверов: вместо стандартной схемы «CPU + GPU» формируются гибридные платформы с несколькими специализированными процессорами.
Ключевые цифры и факты
Почему это важно для рынка ИИ-инфраструктуры
d-Matrix специализируется на inference с момента основания в 2019 году, когда, по словам CEO Сида Шета, «мало кто вообще знал, что такое inference». За последние 12 месяцев произошёл взрыв спроса на низколатентный inference — от AI coding assistants до голосовых агентов. Традиционные GPU, созданные для обучения, неэффективны для этих задач. Подход d-Matrix — memory-centric computing с вертикальным размещением памяти над вычислительным слоем — позволяет достичь значительно более высокой пропускной способности памяти и низких задержек.
Интеграция в экосистему Nvidia через NVLink Fusion даёт d-Matrix доступ к проверенной стоечной архитектуре MGX, сетевому стеку и цепочке поставок Nvidia, позволяя компании сосредоточиться на разработке собственного кремния. Как отметил Сид Шет: «Эта коллаборация с Nvidia — определяющий момент на нашем пути к бесконечному inference, доступному всем».
Технические детали интеграции
| Компонент | Описание |
|---|---|
| Технология подключения | NVLink Fusion — высокоскоростное соединение с малой задержкой для кастомных XPU |
| Стоечная архитектура | Nvidia MGX — модульные безкабельные лотки, проверенная экосистема поставок |
| Компоненты стойки | Vera CPU, NVLink switches, BlueField-4 DPU, ConnectX-9 SuperNIC, Spectrum-X Ethernet |
| Партнёр по подключению | Astera Labs — кастомные решения для высокопроизводительного потока данных |
| Задержка XPU-to-XPU | 3x ниже по сравнению с обычным Ethernet, 10x выше пакетная скорость, 3 ТБ/с all-to-all пропускная способность |
Источник: официальные заявления d-Matrix и Nvidia (сентябрь 2026).
Позиционирование d-Matrix на рынке inference-ускорителей
| Игрок | Подход | Ключевое отличие | Партнёрство с Nvidia |
|---|---|---|---|
| d-Matrix | Memory-centric XPU (Raptor) | Вертикальный стек памяти, 10x быстрее GPU в inference | NVLink Fusion, MGX |
| Nvidia Groq 3 LPX | GPU для decode-фазы | Интеграция в стандартную GPU-экосистему | Собственный продукт |
| AMD | GPU + CPU | Открытая экосистема ROCm | Нет |
| Groq | LPU (Language Processing Unit) | Детерминированная архитектура для inference | Нет |
Источник: отраслевые отчёты, данные компаний (сентябрь 2026).
Рост доли inference в общих затратах на ИИ-вычисления
По оценкам d-Matrix, inference уже составляет 60–70% общих затрат на ИИ-вычисления, и эта доля будет расти. «Обучение — это первые 20 лет. Inference — следующие 40», — отметил CEO компании Сид Шет.
Дорожная карта d-Matrix
Интеграция d-Matrix в экосистему Nvidia — это символ смены архитектурной парадигмы. Если раньше серверы строились по схеме «CPU + GPU», то теперь формируются гибридные платформы с несколькими специализированными процессорами: GPU для prefill-фазы, XPU для decode-фазы, CPU для оркестрации. Nvidia открывает свою экосистему для сторонних производителей кремния через NVLink Fusion, превращаясь из поставщика чипов в платформенного игрока. Для d-Matrix это ускоренный путь к масштабному развёртыванию без необходимости строить собственную стоечную инфраструктуру с нуля. Для рынка — рост конкуренции и ускорение инноваций в области inference-ускорителей.
