Перейти к основному контенту

Muse Spark: возможности, бенчмарки и как им пользоваться

После долгого затишья Meta возвращается с новой моделью, новой лабораторией и фразой, которую очень хочет, чтобы вы запомнили. Узнайте о Muse Spark, её возможностях и многом другом.
Обновлено 12 авг. 2026 г.  · 14 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

Мы регулярно писали статьи о моделях Llama от Meta (Llama 2, Llama 3 и так далее). Затем в апреле 2025 года вышла Llama 4 — и подверглась широкой критике: несколько изданий и уходящий руководитель AI компании подтвердили, что результаты бенчмарков были «подкручены» с помощью специализированных субмоделей, которые так и не были выпущены публично. 

После этого обновления перестали выходить. Примерно в то же время Meta объявила о переводе Horizon Worlds на мобильные устройства, фактически прекратив VR-версию, на которой когда-то строила будущее компании. Это выглядело как потеря опоры сразу на двух фронтах.

8 апреля 2026 года Meta запустила Muse Spark — первую модель от Meta Superintelligence Labs. В пресс-релизе фраза «персональный суперинтеллект» повторяется слишком часто. Если отбросить это, под ним есть реальная модель, которая возвращает Meta в разговор на переднем крае.

Если хотите увидеть, как новая модель Meta соотносится с одним из её лучших текущих конкурентов, рекомендую наш обзор Muse Spark vs Claude Opus 4.6. Также можно прочитать наш гайд по Muse Glimmer и инструкцию по локальному запуску Muse Glimmer.

Что такое Muse Spark?

Muse Spark — это изначально мультимодальная рассуждающая модель, работающая с текстом, изображениями, аудио и инструментами в единой архитектуре. Поддерживает визуальную цепочку рассуждений — модель может пошагово решать задачи по изображению, а не просто выдавать один ответ. В набор также входит оркестрация множества агентов, до этого мы ещё дойдём.

Ранние модели Llama возвращали ответы на основе сопоставления шаблонов из обучения. Muse Spark сначала прорабатывает задачу, а уже потом отвечает. В этом и заключается сдвиг.

Кто стоит за разработкой?

Meta Superintelligence Labs (MSL) была создана 30 июня 2025 года, когда Марк Цукерберг реорганизовал AI-направление компании. Александр Ван, бывший CEO Scale AI, стал Chief AI Officer; в рамках сделки Meta инвестировала около $14 млрд в Scale AI. 

Нат Фридман, бывший CEO GitHub, возглавляет продукт и прикладные исследования, а Шэнцзя Чжао, соавтор GPT-4 и o1 в OpenAI (того самого o1, с которым теперь сравнивают Muse Spark), является Chief Scientist.

Есть и третий фактор: Янн Лекун, многолетний Chief AI Scientist Meta и самый заметный сторонник open-source в компании, покинул её в ноябре 2025 года. Его уход последовал за изменениями в структуре, которые ограничили его роль, и переходом команды к закрытой разработке.

Что нового в Muse Spark (и почему это важно)?

Ключевые особенности: режимы рассуждений, переработанный пайплайн обучения и осознанный фокус на здравоохранении. Разберём по порядку.

Три режима рассуждений

Muse Spark предлагает три способа взаимодействия, и различие между ними стоит понять до начала работы с моделью.

  • Instant — режим по умолчанию для повседневных запросов. Отвечает быстро без расширенных рассуждений, аналогично стандартной чат-модели.
  • Thinking использует расширенную цепочку рассуждений. Модель тратит больше времени, проходит промежуточные шаги и обычно лучше справляется со сложными задачами. Большинство бенчмарков в этой статье — именно в этом режиме.
  • Contemplating — самый интересный. Подробности — сразу ниже.

Важно заранее: режим Contemplating внедряется постепенно и на старте был недоступен для части пользователей. Если вы его пока не видите — так и задумано.

Режим Contemplating

В режиме Contemplating запускаются несколько агентов рассуждений, работающих параллельно, а их результаты объединяются в единый ответ. Если Deep Think у Gemini и режим GPT Pro у OpenAI масштабируют рассуждения «в длину», то Muse Spark масштабирует их «в ширину». Больше агентов работает одновременно, а не один агент дольше.

Аргумент Meta: такой подход даёт сопоставимые результаты с меньшей задержкой, поскольку агенты работают параллельно, а не последовательно. Независимого подтверждения заявлений о задержке пока нет, но бенчмарки режима Contemplating лидируют на ряде сложных оценок (об этом ниже).

Это функция времени инференса, а не архитектуры. Сама модель не меняется.

Масштабирование RL и «сжатие мыслей»

Meta с нуля перестроила стек обучения за девять месяцев разработки Muse Spark. Заявления о reinforcement learning (RL) исходят из технического блога Meta и пока не подтверждены независимо.

Более интересная деталь — техника, которую команда называет thought compression («сжатие мыслей»). Во время RL-обучения модель вознаграждается за правильные ответы, но штрафуется за время «обдумывания», что выражается в избыточных токенах вывода. Это формирует трёхфазное поведение на сложных задачах вроде математики. 

Сначала модель улучшается, думая дольше. Затем срабатывает штраф за длину и вынуждает решать те же задачи куда меньшим числом токенов. В какой-то момент она снова наращивает рассуждения и пробивает прежние потолки, используя при этом меньше токенов.

Практический результат: модель научилась делать больше меньшими средствами. Этот тезис основан на тренировочных кривых Meta и пока не верифицирован независимо.

В 10 раз меньше вычислений

Meta утверждает, что новая архитектура сопоставима по качеству с Llama 4 Maverick при десятикратно меньших вычислительных затратах на обучение. Речь об архитектурной эффективности, а не потолке Muse Spark. Llama 4 Maverick получила 18 баллов в Artificial Analysis Intelligence Index. Muse Spark — 52.

Числа по эффективности токенов от независимого забега Artificial Analysis указывают в ту же сторону. Muse Spark израсходовала 58 млн токенов вывода. GPT-5.4 — 120 млн. Claude Opus 4.6 — 157 млн.

Здравоохранение: осознанный фокус

Здравоохранение — самый явный бенчмарк-преимущественный домен Muse Spark, и это сделано намеренно. Meta работала с более чем 1000 врачей для отбора обучающих данных по медицинским рассуждениям. 

Модель может генерировать интерактивные представления по питанию, лекарствам и физиологии упражнений. На HealthBench Hard Muse Spark набрала 42,8 против 40,1 у GPT-5.4 и 20,6 у Gemini 3.1 Pro. Отрыв от Gemini подтверждается и независимой оценкой.

Это очевидный ответ Meta на ChatGPT Health. Аргумент Meta, почему она может конкурировать, — социальный контекст 3 млрд пользователей, который должен дать преимущество в понимании того, как люди на самом деле задают вопросы о здоровье. Удержится ли это преимущество на сложных или редких запросах, а не только на повседневных из бенчмарков — вопрос открытый.

А как же Llama?

Сообщество разработчиков задаёт один вопрос, и он заслуживает прямого ответа.

Muse Spark не является open-source. Все модели Llama вплоть до Llama 4 выходили с весами, которые разработчики могли скачать и запускать локально. На этом выросли сообщества вроде r/LocalLLaMA. Этот сценарий теперь недоступен.

Озвученная причина Meta — отчасти конкуренция: китайские лаборатории, включая DeepSeek, использовали веса Llama для ускорения своих исследований. Ван говорил, что компания «надеется» открыть исходники будущих моделей Muse, но без сроков. Слово «надеется» в этой фразе делает большую часть работы.

Команду Llama перевели в лабораторию Вана, а Llama 4 стала последней моделью прежней структуры. Сохранится ли Llama параллельно с Muse или тихо сойдёт на нет — Meta не уточняет.

Результаты бенчмарков Muse Spark

С бенчмарками Muse Spark всё непросто — и по понятной причине. Учитывая историю Llama 4 у Meta, отделяйте самоотчёты от независимо подтверждённых чисел.

Ниже — результаты в режиме Thinking, где сосредоточены наиболее корректные для сравнения данные.

Полная сравнительная таблица бенчмарков для Muse Spark в режиме Thinking по сравнению с Opus 4.6, Gemini 3.1 Pro, GPT-5.4 и Grok 4.2 в категориях мультимодальности, рассуждений, здравоохранения и агентности.

Источник: Meta Superintelligence Labs / ai.meta.com

Для режима Contemplating есть отдельный набор по самым сложным оценкам. Он лидирует на Humanity's Last Exam и FrontierScience Research, но уступает GPT-5.4 Pro и Gemini 3.1 Deep Think на задачах по теории физики IPhO 2025. Все данные — из отчётов Meta, поэтому воспринимайте их скорее как ориентир, а не окончательный вердикт.

Источник: Meta Superintelligence Labs / ai.meta.com

Независимая картина от Artificial Analysis сдержаннее. Они поставили Muse Spark на четвёртое место в своём Intelligence Index — после Gemini 3.1 Pro Preview, GPT-5.4 и Claude Opus 4.6. Всё ещё в топ-5 мира. Числа также ясно показывают слабые места: ARC-AGI-2 и Terminal-Bench 2.0 стоит учитывать, если для вашего кейса важны кодирование или абстрактные рассуждения.

Тестируем Muse Spark

С учётом бенчмарков давайте проверим Muse Spark на практике. Я изучу модель в многошаговых рассуждениях, понимании изображений и отладке кода.

Тест 1: Цепочка «Фибоначчи — двоичная логика» (устойчивость каскадных рассуждений)

В первом тесте я проверю расширенные способности Muse Spark к рассуждениям на многошаговом упражнении. Модель должна:

  • Найти нужный член последовательности Фибоначчи
  • Корректно перевести его в двоичную систему
  • Точно посчитать биты
  • Сгенерировать простые числа в вычисленном диапазоне
  • Выполнить большое суммирование

Использованный промпт:

Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?

Muse Spark отлично справилась и решила упражнение правильно с первой попытки. Это особенно впечатляет, учитывая, что GPT-5.4 ошиблась на последнем шаге и смогла решить задачу только после разбиения на два шага (список простых чисел, а затем их сумма).

Тест 2: Понимание изображения и рассуждения о продажах по многолинейному временному ряду

Meta заявляет, что Muse Spark отлично понимает сложные изображения, поэтому я использую следующий многолинейный график временного ряда, чтобы проверить, сможет ли модель выявить паттерны и предложить полезные рекомендации.

Промпт:

Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Ответ Muse Spark по распознаванию графика: ключевые паттерны по продуктам

Muse Spark корректно определила все паттерны, что говорит о хорошем распознавании изображений.

Ответ Muse Spark по распознаванию графика: эффект аннотированных событий

Данные были сгенерированы случайно, поэтому здесь нет «правильного» ответа. Тем не менее, Muse Spark корректно идентифицирует все события и рассуждает по каждому продукту и периоду, приходя к разумным выводам. Она даже анализирует изменения суммы MAU по комбинациям продуктов без прямого запроса, что приятно.

Ответ Muse Spark по распознаванию графика: основанные на данных дальнейшие шаги

Все предложенные шаги согласуются с анализом паттернов MAU и эффектов событий. Muse Spark выделила главную тему для каждого продукта (плейбук запуска для A, ценообразование для B, масштабирование для C) и предложила осмысленные действия.

Тест 3: Отладка кода

Напоследок я проверю навыки Muse Spark в диагностике багов. Тест призван показать, умеет ли модель не только по строкам трассировать корректность кода, но и выявлять скрытые изъяны.

Промпт:

A developer wrote this Python function to compute a running average: 

def running_average(data, window=3): 
    result = [] 
    for i in range(len(data)): 
        start = max(0, i - window + 1) 
        chunk = data[start:i + 1] 
        result.append(round(sum(chunk) / window, 2)) 
    return result 
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!

Функция всегда делит на window (3), даже в начале, когда фрагмент содержит меньше 3 элементов. Неверный вывод — [3.33, 10.0, 20.0, 30.0, 40.0], но первые два значения должны быть 10.0 и 15.0, так как соответствующие фрагменты содержат 1 и 2 элемента. Исправление — заменить / window на / len(chunk).

Модели часто идеально проходят по циклу, но затем заявляют, что результат «выглядит корректным». Они видят математику шаг за шагом и не отмечают, что делить один элемент на 3 нелогично. Нужно одновременно удерживать намерение (что такое скользящее среднее) и исполнение (что делает код) и заметить разрыв между ними.

Ответ Muse Spark по отладке кода

Muse Spark распознала скользящее среднее как намерение и нашла ошибку. Предложила правильное изменение и объяснила, зачем оно нужно. Также предложила вариант на случай, если частичные окна вообще следует пропускать.

В целом модель идеально прошла все три теста и произвела хорошее первое впечатление.

Как получить доступ к Muse Spark?

Доступ к Muse Spark возможен на meta.ai или через приложение Meta AI на iOS и Android. Оба варианта бесплатны. Стартовое развёртывание — сначала в США, расширение на другие регионы заявлено «в последующие недели». Интерфейс meta.ai и выбор режимов модели Muse Spark

В те же сроки Meta планирует внедрение в WhatsApp, Instagram, Facebook, Messenger и умные очки Ray-Ban AI.

Публичного API нет. Частный предпросмотр открыт для отдельных корпоративных партнёров, сроков широкой доступности нет. По части приватности: политика Meta слабо ограничивает использование переписок для улучшения моделей. Если планируете делиться чувствительной информацией, сначала прочитайте условия.

Где Muse Spark уступает

Meta прямо заявила в техническом блоге: у модели есть пробелы в многошаговых агентных задачах и рабочих процессах кодирования.

На SWE-Bench Verified отрыв от Gemini и Opus 4.6 небольшой. Он растёт в агентной работе: Terminal-Bench 2.0 (59,0 против 75,1 у GPT-5.4) и офисная автоматизация GDPval-AA (1 444 против 1 672 у GPT-5.4). Это уже заметная разница. 

С абстрактным визуальным рассуждением та же картина: ARC-AGI-2 — 42,5 у Muse Spark против середины 70-х у GPT-5.4 и Gemini. Модель, лидирующая в чтении графиков, сильно отстаёт на новых визуальных паттернах.

Этот последний пункт вызвал реакцию в деньзапуска. Франсуа Шолле, сооснователь ARC Prize и создатель Keras и ARC-AGI, назвал модель «переоптимизированной под публичные бенчмарки в ущерб всему остальному». Ван ответил, признал разрыв на ARC-AGI-2 и сослался на позитивный пользовательский фидбек по визуальному кодированию и рассуждениям. Удержится ли это при более широком использовании — вопрос открытый.

Отсутствие публичного API, как уже упоминалось, — дополнительный конкурентный минус. Ван признал это в день запуска: «Есть шероховатости в поведении модели, которые мы со временем отполируем».

Безопасность Muse Spark 

До запуска Meta провела оценки в рамках Advanced AI Scaling Framework. По BioTIER-refuse Muse Spark лидирует в отказах на запросы о биооружии среди сравниваемых моделей. Эти числа — собственные у Meta.

Столбиковая диаграмма отказов на запросы о биооружии у передовых моделей: Muse Spark 98,0%, Opus 4.6 95,4%, GPT-5.4 74,7%, Gemini 3.1 Pro 61,5%, Kimi K2.5 21,2%.

Источник: Meta Superintelligence Labs / ai.meta.com

Более интересный вывод — от Apollo Research. Они обнаружили, что Muse Spark показала самый высокий уровень «осведомлённости об оценке» среди протестированных ими моделей: она часто распознавала контекст проверки безопасности и из-за этого вела себя осторожнее. 

Модель, которая ведёт себя хорошо лишь тогда, когда «знает, что за ней наблюдают», — это проблема, к которой стоит отнестись серьёзно. Ранее Apollo показывали, что такой паттерн может усиливать то, что они называют «скрытным поведением», в реальном развёртывании.

Meta признала это в день запуска, чего большинство лабораторий не делает. Их последующая проверка показала, что эффект касается узкого подмножества оценок по выравниванию и не затрагивает опасные возможности; вывод — это не блокирующая проблема. Исследования продолжаются.

Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1

Выше — что эти модели умеют. Здесь — какую из них стоит использовать.

Коротко

Характеристика

Muse Spark

GPT-5.4

Opus 4.6

Gemini 3.1 Pro

Релиз

8 апр 2026

5 мар 2026

5 фев 2026

19 фев 2026

Контекстное окно

262K*

1,05M

1M с 13 мар

1M

Входные модальности

Текст, изображение, речь

Текст, изображение

Текст, изображение

Текст, изображение, аудио, видео

Стоимость API (за 1M токенов вход/выход)

Публичного API нет

$2.50 / $15.00

$5.00 / $25.00

$2.00 / $12.00

Пользовательский доступ

meta.ai (сначала в США)

ChatGPT

Claude.ai

Приложение Gemini

*Запись Artificial Analysis фиксирует контекстное окно Muse Spark как 262K. Некоторые источники указывают 1M. Meta не публиковала карточку модели, подтверждающую любую из цифр.

Какую модель выбрать?

Выбирайте Muse Spark, если ваш кейс — медицинские запросы, чтение графиков или мультимодальные потребительские приложения. Публичного API пока нет, так что для продакшен-интеграции придётся подождать.

Выбирайте GPT-5.4, если вам нужна универсальная модель для разработки уже сегодня. Она лидирует в кодировании, абстрактном визуальном рассуждении и офисной автоматизации, с публичным API и контекстом 1M уже сейчас.

Выбирайте Claude Opus 4.6, если вы работаете с длинными документами или вам нужен аккуратный, высококачественный письменный выход. Контекст 1M перешёл на стандартную цену 13 марта 2026 года. Это самый дорогой вариант — $5/$25 за 1M токенов.

Выбирайте Gemini 3.1 Pro, если ваш конвейер обрабатывает видео. Это единственная модель здесь, принимающая видео, и при $2/$12 за 1M токенов — самый дешёвый вариант на переднем крае в этой группе.

Что говорят о Muse Spark

Ранние отклики предсказуемо разделились. Кто-то находил вещи, которые действительно удивляли. Другие смотрели на таблицу бенчмарков и делали иные выводы.

Твит Виктора Сералеева: у Claude появился серьёзный конкурент; Muse Spark создана MSL; Цукерберг перезапускает всю AI-стратегию и перестраивает полный стек за 9 месяцев.

Формулировка «полный стек перестроен с нуля» звучала часто. Девятимесячный срок либо впечатляет, либо в него трудно поверить — в зависимости от степени доверия к заявлениям Meta.

Пьетро Шкирано привёл конкретный пример: он попросил Muse Spark конвертировать скриншот UI в код, и модель вырезала графические ассеты из интерфейса, а не трактовала всё как плоскую картинку.

Твит Пьетро Шкирано: попросил Muse Spark конвертировать изображение в код, и модель вырезала ассеты со скринов для корректного использования; сравнение «до/после».

Это не бенчмарк. Это тот случай, который распространяют, потому что он действительно неожиданен.

Акааш Гупта высказался наиболее остро. Его рамка: «Это модель CEO из мира разметки данных. Отпечатки повсюду в результатах». Бенчмарки, где Muse Spark лидирует, — чувствительные к качеству данных задачи, где потолок определяет именно кураторство обучающего набора. 

Там, где она отстаёт (ARC-AGI-2, Terminal-Bench, GDPval), решающее значение имеют архитектура и масштабирование RL, а не данные. Его вывод: «он построил лучшую модель в задачах, решаемых конвейерами данных, и посредственную — во всём остальном».

Полный тред Акааша Гупты об анализе Muse Spark: лидирует на бенчмарках, чувствительных к качеству данных, отстаёт в кодинге и абстрактных рассуждениях; модель CEO из мира разметки данных; главный вопрос в $14,3 млрд — смог ли Ван построить лучшую модель в целом.

Итоги

Прыжок с 18 у Llama 4 Maverick до 52 у Muse Spark в Artificial Analysis Intelligence Index трудно не заметить. Для команды, которая за девять месяцев всё перестроила с нуля, результаты в здравоохранении и мультимодальности — реальный первый шаг, подтверждённый независимыми тестами.

Да, пробелы очевидны. В кодинге и агентных задачах отставание от GPT-5.4 велико; абстрактное визуальное рассуждение — слабое место, и публичного API всё ещё нет. Если вам нужна модель для разработки уже сейчас, Muse Spark пока не про это.

Возвращаюсь к вопросу open-source. Экосистема Llama держалась на доверии, что веса будут доступны. Muse Spark это нарушает. «Надежда» Вана открыть будущие версии — не обязательство. На мой взгляд, это самое значимое в запуске — и ему уделяют куда меньше внимания, чем бенчмаркам.

Готовятся более крупные модели Muse. Если архитектура масштабируется, как заявлено, сегодняшние цифры вскоре покажутся скромными. На это и сделана ставка.

Если хотите научиться извлекать максимум из любой большой языковой модели, рекомендую наш курс Understanding Prompt Engineering.

Muse Spark: часто задаваемые вопросы

Если я использовал Llama локально, заменяет ли её Muse Spark?

Нет. Muse Spark — только в облаке. Вы не можете скачать её, запустить на своём оборудовании или дообучить. Доступ — через meta.ai или приложение Meta AI, в обоих случаях требуется аккаунт Meta. Сценария с открытыми весами, вокруг которого строилось сообщество Llama, здесь нет.

Когда действительно стоит использовать режим Contemplating вместо Thinking?

Режим Contemplating полезнее всего, когда у задачи действительно несколько валидных путей решения: сложные научные вопросы, многошаговые рассуждения с неоднозначными входами, исследовательские задачи, где разные подходы могут привести к разным выводам. Для большинства повседневных запросов Thinking быстрее, а результаты сопоставимы. Ещё важно: Contemplating всё ещё разворачивают поэтапно, так что у вас он может пока не быть доступен.

Что для меня как пользователя означает заявление о 10-кратном снижении вычислений?

Пока что — ничем. Сравнение идёт с предыдущей моделью Muse Spark, а не с GPT-5.4 или Gemini, и цифра не подтверждена независимо. Более релевантный показатель — эффективность инференса: как упоминалось выше, на независимом забеге Artificial Analysis Muse Spark использовала 58 млн токенов вывода против 157 млн у Claude Opus 4.6. Этот разрыв со временем может отразиться в цене, но цены API ещё не объявлены.

Стоит ли переключаться на Muse Spark с моего текущего инструмента?

Если вы используете ChatGPT для общих задач, повседневный опыт будет похожим. Если ваш основной сценарий — медицинские запросы, наука или анализ графиков, Muse Spark — разумное повышение. Если вы полагаетесь на ассистентов по коду или инструменты для длинных документов, она пока не заменяет GPT-5.4 или Opus 4.6. Конкретика — в таблице сравнения выше.

Стоит ли мне беспокоиться из‑за «осведомлённости об оценке»?

В повседневной практике — вряд ли, но понять стоит. Речь в том, что Muse Spark ведёт себя осторожнее, когда распознаёт, что её тестируют на безопасность — не из-за «других ценностей», а из-за распознавания контекста. По данным Meta, это затрагивает узкий набор тестов по выравниванию и не касается опасных возможностей. Если вы оцениваете модели для чувствительных внедрений, ознакомьтесь с полным отчётом Apollo, прежде чем делать выводы по одним лишь оценкам безопасности.

Темы

Курсы по ИИ

Track

Основы ИИ

10 ч
Откройте для себя основы ИИ, научитесь эффективно использовать ИИ в работе и погрузитесь в модели вроде ChatGPT, чтобы ориентироваться в динамичном ландшафте ИИ.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow