Перейти к основному контенту

Как запустить Motif 3 локально с DS4 и превратить его в кодового агента

Запустите оптимизированный Motif-3 Quant на NVIDIA H200 с рантаймом ds4, предоставьте его через совместимый с OpenAI API и интегрируйте с кодовым агентом Pi.
Обновлено 21 сент. 2026 г.  · 8 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

Motif-3 — это модель типа mixture-of-experts с 314 млрд параметров, полностью созданная с нуля компанией Motif Technologies — командой примерно из 30 человек в Южной Корее — в рамках государственной программы суверенного ИИ Dokpamo. Она вышла в августе 2026 года по лицензии MIT, что делает её одной из немногих открытых моделей фронтирного масштаба, разработанных за пределами США и Китая.

В этом руководстве используется Baekpica/Motif-3-Mixed-Quant-GGUF — независимая версия со смешанной квантизацией, сохраняющая полную архитектуру модели и уменьшающая её размер до примерно 94 ГБ. Я запускаю её на Hyperbolic NVIDIA H200 с 141 ГБ видеопамяти, чего достаточно, чтобы держать квантованную модель в памяти GPU и оставить запас для инференса, рантайма и KV-кэша.

В этом руководстве вы узнаете, как:

  1. Настроить сервер с H200 GPU для запуска Motif-3.
  2. Скачать файлы Motif-3 Mixed Quant GGUF с Hugging Face.
  3. Объединить шардированные файлы GGUF в один файл модели.
  4. Скомпилировать и настроить рантайм ds4 для H200.
  5. Загрузить Motif-3 на GPU и запустить сервер API, совместимый с OpenAI.
  6. Протестировать модель с помощью простых запросов curl.
  7. Подключить Motif-3 к кодовому агенту Pi.
  8. Использовать Motif-3 как автономного кодового агента для создания и тестирования небольшого приложения на Python.

Что такое Motif 3?

Motif-3 — это крупномасштабная Mixture-of-Experts (MoE) модель от Motif Technologies, содержащая в сумме 314 млрд параметров и активирующая лишь 13,2 млрд параметров на токен. 

Она включает 384 маршрутизируемых эксперта, имеет контекстное окно 256K и обучалась примерно на 12,5 трлн токенов, охватывающих код, математику, STEM, многоязычные данные и другие домены. 

Модель особенно хорошо подходит для задач рассуждения, программирования и агентных рабочих нагрузок. В Индексе Artificial Analysis Intelligence она набирает 47 баллов, что ставит её между Qwen3.8-27B и MiniMax-M3, который мы тестировали в схожей конфигурации.

Индекс Artificial Analysis для Motif3

Источник: AI Model & API Providers Analysis | Artificial Analysis 

Что такое Mixed Quant GGUF?

В этом руководстве мы используем Baekpica/Motif-3-Mixed-Quant-GGUF — независимую квантованную версию Motif-3. Вместо единой точности для всей модели применяется смешанная квантизация: более высокая точность для важных компонентов и значительно более низкая — для огромных слоёв экспертов.

Например, важные компоненты внимания и всегда активные части используют Q8_0, тогда как значительная часть весов маршрутизируемых экспертов — IQ2_XXS и Q2_K. Модель по‑прежнему содержит всех 384 эксперта и все 53 слоя — ничего не обрезано и не удалено. Это уменьшает размер модели до примерно 94 ГБ по сравнению с ~335 ГБ для Q8_0 GGUF, делая её достаточно компактной для полного запуска на H200 с 141 ГБ и с дополнительной видеопамятью для рантайма и KV‑кэша.

Для дополнительного бэкграунда рекомендуем прочитать наши руководства по квантизации LLM и по формату GGUF.

1. Аренда и настройка сервера с H200 GPU

Motif-3 Mixed Quant занимает около 94 ГБ, поэтому вам понадобится GPU с достаточной видеопамятью, чтобы загрузить модель и оставить место для инференса. Рекомендуется арендовать один NVIDIA H200 с 141 ГБ VRAM у облачного провайдера GPU, например Hyperbolic, RunPod или Vast.ai.

запуск H200 GPU в Hyperbolic

Когда инстанс будет запущен, подключитесь к нему из терминала или через VS Code Remote SSH. Провайдер предоставит IP‑адрес. Команда будет выглядеть примерно так:

ssh root@<SERVER_IP> -L 8080:localhost:8080

Опция -L 8080:localhost:8080 также пробрасывает порт API Motif-3 на ваш локальный ПК, так что позже вы сможете обращаться к нему по адресу http://127.0.0.1:8080.

Теперь подготовьте сервер:

apt update
apt install -y git cmake build-essential python3-pip

pip install -U huggingface_hub

mkdir -p /workspace/motif3
cd /workspace/motif3

Наконец, проверьте доступность H200:

nvidia-smi

сводка по H200 GPU

Вы должны увидеть NVIDIA H200 с примерно 141 ГБ видеопамяти.

2. Скачайте Motif-3 Mixed Quant GGUF

Далее скачайте модель Baekpica/Motif-3-Mixed-Quant-GGUF с Hugging Face. Мы используем вариант MQ87-88-FIT, который разделён на 11 файлов GGUF суммарным размером около 94 ГБ.

Из каталога /workspace/motif3 выполните:

hf download Baekpica/Motif-3-Mixed-Quant-GGUF \
  --include "Motif-3-MQ87-88-FIT-*.gguf" \
  --include MQ87-88-FIT-SHA256SUMS \ 
  --local-dir model

Скачивание Motif-3 Mixed Quant GGUF

В зависимости от скорости соединения загрузка всех 94 ГБ может занять время. Когда всё будет готово, проверьте наличие всех шардов:

ls -lh model

Перед объединением проверьте шардированные файлы. Слияние — одноразовая операция на 94 ГБ, поэтому лучше вовремя обнаружить сбой загрузки:

cd model && sha256sum -c MQ87-88-FIT-SHA256SUMS && cd ..

3. Объедините шардированные файлы GGUF

Рантайм ds4 ожидает модель в виде единого файла GGUF, поэтому сначала нужно объединить 11 загруженных шардов.

Клонируйте llama.cpp и соберите утилиту GGUF:

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git

cmake -S llama.cpp -B llama.cpp/build -DLLAMA_CURL=OFF

cmake --build llama.cpp/build \
  --target llama-gguf-split \
  -j$(nproc)

Теперь объедините все 11 шардов в один файл:

./llama.cpp/build/bin/llama-gguf-split --merge \
  model/Motif-3-MQ87-88-FIT-00001-of-00011.gguf \
  motif3.gguf

Проверьте объединённую модель:

ls -lh motif3.gguf

Вы должны увидеть крупный файл motif3.gguf

4. Установите рантайм Motif-3

Нам нужен рантайм ds4, чтобы эффективно загружать и обслуживать Motif-3 на NVIDIA H200.

Клонируйте ветку dfm:

git clone --branch dfm https://github.com/Baekpica/ds4.git
cd ds4

Соберите с поддержкой CUDA для H200 (Hopper, sm_90). Учтите, что основная цель ds4 — DGX Spark/GB10, а поддержка H200 обеспечена в рамках начальных работ по проекту, а не основного пути сервинга:

make cuda CUDA_ARCH=sm_90 -j$(nproc)

Убедитесь, что бинарные файлы успешно созданы:

ls -lh ds4*

Вы должны увидеть бинарники вроде ds4-server и ds4_weight_server.

5. Загрузите Motif-3 на GPU

Сервер весов загружает и управляет весами модели на GPU, чтобы сервер API мог использовать их для инференса.

Сначала создайте каталоги для файлов рантайма и KV‑кэша:

mkdir -p /workspace/motif3/run
mkdir -p /workspace/motif3/kv

Сначала выполните предварительную проверку, чтобы убедиться, что модель поместится, прежде чем запускать полную загрузку:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned \
  --dry-run

Если проверка прошла, запустите ту же команду без --dry-run:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned

Загрузка Motif-3 на GPU

Оставьте этот терминал открытым. Сервер весов должен оставаться активным, пока вы запускаете Motif-3.

6. Запустите и протестируйте сервер API Motif-3

Теперь запустим сервер API ds4, который предоставляет Motif-3 через совместимую с OpenAI конечную точку, доступную с вашего локального компьютера.

Откройте второй терминал, подключитесь к серверу и перейдите в каталог ds4:

cd /workspace/motif3/ds4

Задайте необходимые переменные окружения:

export DS4_CUDA_WEIGHT_IPC_MANIFEST=/workspace/motif3/run/weights.manifest
export DS4_CUDA_WEIGHT_IPC_SCOPE=base
export DS4_SERVER_COALESCE_MAX=2
export DS4_SERVER_COALESCE_MAX_TOKENS=4096
export DS4_MOTIF3_PREFILL_CHUNK=4096

Запустите сервер API с контекстным окном 125K. На H200 рантайм валидирован до 128K, а 256K достигает лишь частичного префилла, поэтому 125K укладывается в протестированные рамки:

./ds4-server \
  -m /workspace/motif3/motif3.gguf \
  --cuda \
  -c 125000 \
  --host 0.0.0.0 \
  --port 8080 \
  --no-spec \
  --kv-disk-dir /workspace/motif3/kv \
  --kv-disk-space-mb 32768

Запуск сервера API Motif-3

Оставьте этот терминал открытым.

Поскольку ранее мы пробросили порт 8080 по SSH, теперь вы можете открыть терминал на своём локальном ПК и проверить API:

curl http://127.0.0.1:8080/v1/models

Тестирование сервера API Motif-3

Вы должны увидеть, что модель motif-3 доступна с длиной контекста 125000.

Теперь отправьте первый запрос:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "motif-3",
    "messages": [
      {
        "role": "user",
        "content": "Explain mixture-of-experts models in simple terms."
      }
    ],
    "max_tokens": 256,
    "temperature": 0
  }'

Тестирование сервера API Motif-3

Если всё работает, Motif-3 сгенерирует ответ напрямую с вашего H200. В моём тесте модель показала такие метрики:

  • Скорость генерации: 23,7 токена/с
  • Скорость префилла: 189,3 токена/с
  • Время до первого токена (TTFT): около 90 мс

Вы также можете проверить использование памяти GPU на сервере:

nvidia-smi

Сводка GPU после полной загрузки модели Motif-3

В моей конфигурации Motif-3 использовала примерно 101 ГБ из 141 ГБ доступной памяти GPU H200, оставляя дополнительную VRAM для инференса и KV‑кэша.

7. Подключите Motif-3 к кодовому агенту Pi

Теперь подключим локальный API Motif-3 к Pi, чтобы модель могла работать как кодовый агент, создающий файлы, выполняющий команды и итеративно дорабатывающий проект.

Убедитесь, что Motif-3 по‑прежнему доступна по адресу:

http://127.0.0.1:8080/v1

Установите Pi с помощью официального инсталлятора:

curl -fsSL https://pi.dev/install.sh | sh

Перезапустите терминал, затем подтвердите установку:

pi --version

Pi поддерживает пользовательские модели, совместимые с OpenAI, через ~/.pi/agent/models.json. Создайте конфигурацию:

mkdir -p ~/.pi/agent

cat > ~/.pi/agent/models.json <<'EOF'
{
  "providers": {
    "motif-local": {
      "baseUrl": "http://127.0.0.1:8080/v1",
      "api": "openai-completions",
      "apiKey": "none",
      "models": [
        {
          "id": "motif-3",
          "name": "Motif-3",
          "reasoning": true,
          "input": ["text"],
          "contextWindow": 125000,
          "maxTokens": 125000
        }
      ]
    }
  }
}
EOF

8. Протестируйте Motif-3 как кодового агента

Теперь можно дать Motif-3 реальную задачу по программированию и посмотреть, сможет ли она самостоятельно собрать, запустить и улучшить приложение.

Создайте тестовый проект и запустите Pi:

mkdir -p ~/motif-test
cd ~/motif-test
pi

агент Pi интегрирован с локально запущенной моделью Motif3

Создание простого приложения «список дел» с Motif-3

Протестируем модель. Сначала попросим её собрать простое приложение со списком дел.

Create a simple Python CLI to-do app that can add, list, complete, and delete tasks, save them locally to a JSON file, then run and test it.

Через несколько минут Motif-3 создала рабочее CLI‑приложение и успешно его протестировала. Функциональность была хорошей, но начальный интерфейс — очень базовым.

Тестирование модели Motif3 как кодового агента в Pi

Затем я попросил(а) агента сделать приложение более интерактивным и цветным, улучшить компоновку и опыт работы в терминале. Motif-3 изменила существующий проект, а не начала заново, и улучшенная версия получилась заметно более отполированной.

CLI‑приложение TODO, сгенерированное Motif3 и Pi

Создание веб‑сайта с Motif-3

Напоследок хотелось увидеть, как Motif-3 справится с более визуальной задачей веб‑разработки, где работающий сайт — лишь часть вызова.

image4.png

Базовое приложение работало, но было несколько UI‑моментов, которые мне не понравились. Вместо того чтобы давать модели один огромный запрос на редизайн, я просил(а) исправлять проблемы по одной, улучшая отдельные части интерфейса по мере тестирования.

Это сработало удивительно хорошо. Motif-3 смогла изучить существующий проект, внести точечные изменения и многократно отшлифовать интерфейс, сохраняя при этом работоспособность приложения. 

В целом впечатлила и производительность в кодинге, и способность итеративно дорабатывать существующий проект через Pi.

image9.png

Итоги

В целом впечатления смешанные. Motif-3 впечатляет, но для большинства пользователей есть модели лучше и менее требовательные к памяти.

Даже со смешанной квантизацией, которая сильно уменьшает размер, вам всё равно нужно около 100 ГБ и более видеопамяти или совокупной памяти, чтобы комфортно её запускать. Из‑за этого есть много меньших моделей, которые гораздо проще запустить, например Qwen3.8-27B и другие модели, ориентированные на код.

Тем не менее, если вам нужно что-то ближе к классу DeepSeek Flash моделей, Motif-3 остаётся очень интересным вариантом. На H200 она быстрая, качество кода хорошее, и, вероятно, можно выжать ещё больше производительности с лучшей настройкой. 

Основная проблема была с кодовым агентом Pi: генерация иногда останавливалась или прерывалась. Я увеличил(а) некоторые лимиты вывода — это помогло, но проблему полностью не устранило. Это также мой первый опыт с рантаймом DS4, так что, вероятно, впереди ещё есть пространство для оптимизации.

И всё же, если вы специально ищете модель, разработанную в Корее, или хотите альтернативу моделям из Китая, это один из наиболее интересных вариантов прямо сейчас. Здорово видеть, как всё больше стран создают собственные модели ИИ и экосистемы вместо зависимости от нескольких крупных провайдеров.

FAQ по Motif-3

Что такое Motif 3?

Motif 3 — это языковая модель типа mixture-of-experts с 314 млрд параметров от Motif Technologies, южнокорейской компании. Она активирует 13,2 млрд параметров на токен среди 384 маршрутизируемых экспертов с top-8 маршрутизацией и была предобучена примерно на 12,5 трлн токенов.

Можно ли использовать Motif 3 в коммерческих целях?

Да. Финальные веса Motif 3 выпущены под лицензией MIT, которая допускает коммерческое использование, дообучение и распространение. Обратите внимание, что ранний превью-релиз Motif-3-Beta имел ограничение «не для коммерческого использования», поэтому убедитесь, что вы используете финальный чекпоинт.

Какое оборудование нужно, чтобы запустить Motif 3 локально?

В полной точности — гораздо больше, чем есть у большинства людей. Со смешанной квантизацией GGUF, используемой в этом руководстве, размер модели снижается до примерно 94 ГБ, что помещается на одном H200 с 141 ГБ или на DGX Spark 128 ГБ с запасом для рантайма и KV‑кэша.

Какое контекстное окно у Motif 3?

262 144 токена, или 256K. На практике используемый контекст зависит от рантайма и доступной памяти. На H200 путь ds4 валидирован до 128K, а 256K достигает лишь частичного префилла.

В чём хорош Motif 3?

Модель обучалась с сильным акцентом на код, математику и данные STEM и показывает особенно хорошие результаты на бенчмарках агентности и использования инструментов. Она также сильна в корейском языке, что неудивительно с учётом её происхождения.

Темы
AI Agents
Искусственный интеллект

Изучайте ИИ с DataCamp!

Track

Ассоциированный AI-инженер для разработчиков

26 ч
Узнайте, как интегрировать ИИ в программные приложения с помощью API и библиотек с открытым исходным кодом. Начните свой путь к профессии AI Engineer уже сегодня!
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow