К нам едет Канье Уэст? 🤩 Да не, бред какой-то, к нам едет само NVidea ! 🎮 😎

DGX Spark в SaaSoft: собираем кластер для локального ИИ
К нам приехали две NVIDIA DGX Spark — компактные машины для запуска больших ИИ-моделей прямо на месте, без облака. Соединяем их в кластер и дальше будем делиться результатами: что эти машины реально умеют и где нас удивят, а где разочаруют.
Что такое DGX Spark
DGX Spark — это настольный компьютер размером с толстую книгу (около 150×150×50 мм, 1,2 кг), внутри которого стоит чип Grace Blackwell GB10: 20 ARM-ядер (10 производительных Cortex-X925 и 10 энергоэффективных Cortex-A725) и GPU архитектуры Blackwell с 6144 CUDA-ядрами и 192 тензорными ядрами пятого поколения. Пиковая производительность — до 1 петафлопса в разреженном режиме FP4.
Ключевая особенность — 128 ГБ унифицированной памяти LPDDR5x на скорости 8533 МТ/с (около 273 ГБ/с пропускной способности), общей для процессора и видеокарты. Именно объём памяти, а не только вычислительная мощность, определяет, какие модели вообще можно запустить локально: большая языковая модель должна целиком поместиться в память, иначе она просто не загрузится. Плюс 4 ТБ NVMe SSD с аппаратным шифрованием, сеть — 10GbE и два порта QSFP на 200 Гбит/с, питание — 240 Вт через USB-C. Цена одной машины — 4699 долларов.
Для сравнения: обычная игровая видеокарта топового уровня даёт больше "сырых" флопсов, но имеет 16–24 ГБ памяти — туда крупная модель не влезет вообще. По скорости DGX Spark уступает серверным GPU, зато на столе у разработчика такого объёма памяти для локальной модели раньше не было.

Зачем нужен кластер из двух машин
Два DGX Spark соединяются одним кабелем QSFP на 200 Гбит/с напрямую, без коммутатора, и образуют кластер с прямым RDMA-соединением между узлами. Модель разбивается на части и считается сразу на двух GPU — это называется тензорным параллелизмом.
Главный эффект — суммарная память. Одна машина — 128 ГБ, две — 256 ГБ. Это открывает доступ к моделям, которые физически не помещаются в один узел: например, Llama 3.1 405B в формате FP4 или крупные MoE-модели на 200–235 миллиардов параметров. Скорость генерации токенов у одной модели от этого сама по себе почти не растёт — она упирается в пропускную способность памяти каждого отдельного узла. Зато освобождается память под больший кэш контекста, то есть модель может держать в голове более длинный диалог или документ, и обслуживать больше параллельных запросов одновременно.
Зачем это SaaSoft
Мы разрабатываем ПО на заказ, делаем QA и предоставляем аутсорс/аутстафф — то есть постоянно работаем с чужим кодом и чужими данными. Отправлять код клиента во внешний облачный ИИ-сервис для многих заказчиков неприемлемо по контракту или по соображениям безопасности. Локальный кластер снимает этот вопрос: модель считает у нас на площадке, код и данные никуда не уходят.
Мы хотим закрыть несколько задач.
Во-первых, ИИ-ассистент для разработчиков на .NET и QA-инженеров, обученный или дообученный на внутренних наработках и стандартах компании, без ежемесячной оплаты по токенам и без утечки исходников третьей стороне.
Во-вторых, автоматизация тестирования: агенты, которые сами прогоняют сценарии, пишут тест-кейсы, анализируют баги — это ложится прямо на профиль QA-направления.
В-третьих, это R&D перед тем, как предлагать клиентам ИИ-компоненты в их собственных проектах: полезнее сначала обкатать связку моделей и железа на себе, чем продавать то, что сами не пробовали.
Мы поставили цель расти и масштабироваться. При кратном росте производительность каждого разработчика и тестировщика напрямую влияет на то, сколько людей реально понадобится нанять. Локальный ИИ, который ускоряет рутинные задачи и не создаёт риски для контрактов с клиентами поможет с решением задачи - как расти без пропорционального роста штата на каждый рубль выручки.
Что дальше
Сейчас настраиваем кластер и гоняем на нём реальные модели и реальные задачи — не синтетические тесты, а то, с чем работаем каждый день: код-ревью, генерация тестов, работа с внутренней документацией. Результаты — цифры по скорости, по качеству ответов, по тому, что оказалось сюрпризом в плюс или в минус — опубликуем отдельно.