본문으로 바로가기

Muse Spark: 기능, 벤치마크, 그리고 사용 방법

오랜 침묵 끝에 Meta가 새 모델, 새 연구소, 그리고 꼭 기억하길 바라는 문구와 함께 돌아왔습니다. Muse Spark와 그 기능 등을 알아보세요.
업데이트됨 2026년 8월 12일  · 14분 읽다

AI로 탐색하기

ChatGPTClaudePerplexity

우리는 Meta의 Llama 모델들에 대해 꾸준히 글을 써 왔습니다(Llama 2, Llama 3 등). 그러다 2025년 4월 Llama 4가 출시되자 여러 매체와 회사의 퇴임하는 AI 책임자가, 공개되지 않은 특수 서브모델을 사용해 벤치마크 결과를 조작했다고 확인하며 광범위한 비판이 이어졌습니다. 

그 이후로 업데이트는 멈췄습니다. 같은 시기 Meta는 Horizon Worlds를 모바일 전용으로 전환한다고 발표하여, 한때 회사의 미래를 걸었던 VR 버전을 사실상 종료했습니다. 두 전선에서 동시에 발을 헛디디는 듯 보였습니다.

2026년 4월 8일, Meta는 Meta Superintelligence Labs의 첫 모델인 Muse Spark를 출시했습니다. 보도자료는 "personal superintelligence"라는 표현을 다소 과하게 반복합니다. 그 포장을 걷어내면, 최전선 논의로 Meta를 다시 끌어올릴 만한 실체 있는 모델이 숨어 있습니다.

Meta의 새 모델이 현재 최고의 경쟁자 중 하나와 어떻게 비교되는지 보고 싶다면, 저희의 Muse Spark vs Claude Opus 4.6 가이드를 권합니다. 또한 Muse Glimmer 가이드Muse Glimmer를 로컬에서 실행하는 튜토리얼도 읽어보세요.

Muse Spark란 무엇인가?

Muse Spark는 텍스트, 이미지, 오디오, 도구 사용을 단일 아키텍처에서 다루는 네이티브 멀티모달 추론 모델입니다. 시각적 체인 오브 소트를 지원해, 단일 답만 내는 것이 아니라 이미지 기반 문제를 단계별로 풀이할 수 있습니다. 멀티 에이전트 오케스트레이션도 구성 일부이며, 이에 대해서는 아래에서 다루겠습니다.

이전 Llama 모델은 학습에서의 패턴 매칭을 바탕으로 답을 반환했습니다. Muse Spark는 응답하기 전에 문제를 풀어 나갑니다. 이것이 실제 변화입니다.

누가 만들었나?

Meta Superintelligence Labs(MSL)는 2025년 6월 30일 Mark Zuckerberg가 회사의 AI 조직을 재편하며 설립했습니다. Scale AI의 전 CEO Alexandr Wang이 Chief AI Officer로 합류했고, 거래의 일환으로 Meta는 Scale AI에 약 140억 달러를 투자했습니다. 

GitHub 전 CEO Nat Friedman이 제품 및 응용 연구를 이끌고, OpenAI에서 GPT-4와 o1을 공동 개발한 Shengjia Zhao(현재 Muse Spark가 벤치마크로 삼는 그 o1)가 Chief Scientist를 맡고 있습니다.

여기에는 또 하나 짚고 넘어갈 지점이 있습니다. Meta의 오랜 Chief AI Scientist이자 회사의 가장 가시적인 오픈소스 옹호자였던 Yann LeCun이 2025년 11월에 떠났습니다. 그의 퇴사는 역할을 제한한 조직 개편과 팀의 폐쇄형 개발 전환 이후에 이루어졌습니다.

Muse Spark에는 무엇이 새롭나(그리고 왜 중요할까)?

핵심 특징은 추론 모드, 재구성된 학습 파이프라인, 그리고 건강 분야에 대한 의도적인 집중입니다. 차례대로 살펴보겠습니다.

세 가지 추론 모드

Muse Spark와 상호작용하는 방법은 세 가지이며, 모델을 사용하기 전에 그 차이를 이해할 가치가 있습니다.

  • Instant는 일상적 질문에 대한 기본 모드입니다. 확장 추론 없이 빠르게 응답하며, 일반적인 챗 모델과 유사한 경험을 제공합니다.
  • Thinking은 확장된 체인 오브 소트 추론을 사용합니다. 더 많은 시간을 들여 중간 단계를 거치며, 일반적으로 어려운 문제에서 더 잘 수행합니다. 이 글의 대부분 벤치마크는 이 모드 기반입니다.
  • Contemplating이 가장 흥미로운 모드입니다. 자세한 내용은 바로 아래에서 설명합니다.

미리 알아둘 점 하나: Contemplating 모드는 점진적으로 롤아웃 중이며 출시 당일에는 모든 사용자에게 제공되지 않았습니다. 아직 보이지 않더라도 정상입니다.

Contemplating 모드

Contemplating 모드는 여러 추론 에이전트를 병렬로 띄워 작업한 후, 그 출력을 단일 응답으로 결합합니다. Gemini의 Deep Think와 OpenAI의 GPT Pro 모드가 더 오래 생각하는 방식으로 추론을 확장한다면, Muse Spark는 더 넓게 생각하는 방식으로 확장합니다. 한 에이전트가 오래 일하는 대신 더 많은 에이전트가 동시에 일합니다.

Meta의 주장은 이 접근이 순차가 아닌 병렬 실행이므로 더 낮은 지연으로 유사한 결과를 낸다는 것입니다. 지연 시간에 대한 독립 검증은 아직 없지만, Contemplating 모드의 벤치마크 수치는 몇몇 어려운 평가에서 선두를 보입니다(곧 자세히 다룹니다).

이는 추론 시점 기능이며, 아키텍처 변경은 아닙니다. 모델 자체는 바뀌지 않습니다.

강화학습 확장과 사고 압축

Meta는 Muse Spark 개발에 9개월을 들여 학습 스택을 처음부터 다시 만들었다고 합니다. 특히 강화학습(RL)에 관한 주장은 Meta의 기술 블로그에 기반하며 독립 검증은 아직 없습니다.

더 흥미로운 세부는 연구팀이 사고 압축(thought compression)이라 부르는 기법입니다. RL 학습 중 모델은 정답을 맞히면 보상을 받지만, 생각하는 시간(과도한 출력 토큰)에는 페널티가 부과됩니다. 이는 수학 문제 같은 복잡한 작업에서 세 단계의 행동을 유도합니다. 

먼저 모델은 더 오래 생각하며 개선됩니다. 그 다음 길이 페널티가 작동해 훨씬 적은 토큰으로 같은 문제를 풀도록 강제합니다. 어느 시점에서 모델은 다시 추론을 확장하면서, 더 적은 토큰을 쓰면서도 이전 성능 상한을 넘어섭니다.

실용적 결과는 이렇습니다: 모델이 적은 리소스로 더 많이 하도록 학습되었습니다. 이 주장 역시 Meta의 자체 학습 곡선에 근거하며, 독립 검증은 없습니다.

연산량 10배 절감

Meta는 새 아키텍처가 Llama 4 Maverick과 동일한 성능을 학습 연산량 10분의 1로 달성한다고 주장합니다. 이는 아키텍처 효율성에 관한 것이지 Muse Spark의 상한선에 관한 이야기는 아닙니다. Llama 4 Maverick은 Artificial Analysis Intelligence Index에서 18점을 받았습니다. Muse Spark는 52점입니다.

Artificial Analysis의 독립 실행에서의 토큰 효율성 수치도 같은 방향을 가리킵니다. Muse Spark는 출력 토큰 5,800만 개를 사용했습니다. GPT-5.4는 1억 2,000만 개, Claude Opus 4.6은 1억 5,700만 개를 사용했습니다.

건강: 의도적 집중

건강은 Muse Spark가 가장 두드러지게 앞서는 벤치마크 분야이며, 이는 의도적인 결과입니다. Meta는 1,000명 이상의 의사와 협력해 건강 추론을 위한 학습 데이터를 선별했습니다. 

모델은 영양 성분, 의약품 정보, 운동 생리학을 다루는 인터랙티브 디스플레이를 생성할 수 있습니다. HealthBench Hard에서 Muse Spark는 42.8점을 기록했으며, GPT-5.4는 40.1, Gemini 3.1 Pro는 20.6이었습니다. Gemini 대비 격차는 독립 평가에서도 유지됩니다.

이는 분명 ChatGPT Health에 대한 Meta의 답입니다. Meta가 경쟁력을 주장하는 근거는 30억 사용자에 달하는 사회적 맥락으로, 사람들이 실제로 건강 질문을 어떻게 하는지 이해하는 데 우위를 줄 수 있다는 점입니다. 그 우위가 벤치마크에 많은 일상적 질문이 아닌 복잡하거나 드문 질의에도 유지되는지는 지켜볼 가치가 있습니다.

Llama는 어떻게 되는가?

개발자 커뮤니티가 가장 궁금해하는 질문이 있으며, 직접적으로 답할 필요가 있습니다.

Muse Spark는 오픈소스가 아닙니다. Llama 4까지의 모든 Llama 모델은 개발자가 가중치를 다운로드하여 로컬에서 실행할 수 있었습니다. r/LocalLLaMA 같은 커뮤니티가 그 위에 구축되었습니다. 그 사용 사례는 사라졌습니다.

Meta가 밝힌 이유 중 하나는 경쟁 때문입니다. DeepSeek을 포함한 중국 연구소들이 Llama 가중치를 활용해 자체 연구를 가속했다는 것입니다. Wang은 향후 Muse 모델을 오픈소스로 공개하기를 "희망한다"고 했지만, 일정은 없습니다. 그 문장에서 "희망한다"는 단어가 너무 많은 것을 떠맡고 있습니다.

Llama 팀은 Wang의 연구소로 이동했고, Llama 4가 기존 체계에서 나온 마지막 모델이었습니다. Llama가 Muse와 병행해 계속될지, 조용히 단종될지는 Meta가 밝히지 않았습니다.

Muse Spark 벤치마크 결과

Muse Spark의 벤치마크는 시작부터 짚고 넘어갈 이유가 있습니다. Meta의 Llama 4 전력을 감안할 때, 자체 보고 수치와 독립 검증 수치는 구분해 봐야 합니다.

다음은 대부분의 공정 비교 데이터가 담긴 Thinking 모드 결과입니다.

멀티모달, 추론, 건강, 에이전트 카테고리 전반에서 Muse Spark Thinking 모드와 Opus 4.6, Gemini 3.1 Pro, GPT-5.4, Grok 4.2의 전체 벤치마크 비교 표.

출처: Meta Superintelligence Labs / ai.meta.com

Contemplating 모드는 가장 어려운 평가를 위한 별도 세트가 있습니다. Humanity's Last Exam과 FrontierScience Research에서는 선두지만, IPhO 2025 Theory 물리 문제에서는 GPT-5.4 Pro와 Gemini 3.1 Deep Think에 뒤처집니다. 모두 Meta의 자체 보고이므로, 확정값보다는 방향성 있는 신호로 읽으시기 바랍니다.

출처: Meta Superintelligence Labs / ai.meta.com

Artificial Analysis의 독립적 평가는 보다 절제되어 있습니다. 그들의 Intelligence Index에서 Muse Spark는 Gemini 3.1 Pro Preview, GPT-5.4, Claude Opus 4.6에 이어 4위를 차지했습니다. 여전히 전 세계 상위 5위권입니다. 또한 취약점도 분명합니다. 코딩이나 추상 추론이 중요하다면 ARC-AGI-2와 Terminal-Bench 2.0 결과를 주목하세요.

Muse Spark 테스트

위의 벤치마크 점수를 염두에 두고, Muse Spark를 직접 시험해 보겠습니다. 다단계 추론, 이미지 이해, 코드 디버깅에서 모델을 살펴봅니다.

테스트 1: 피보나치–이진 논리 체인(연쇄 추론 안정성)

첫 번째 테스트에서는 다단계 과제를 통해 Muse Spark의 고급 추론 능력을 겨냥합니다. 모델은 다음을 수행해야 합니다.

  • 올바른 피보나치 항 식별
  • 정확한 이진수 변환
  • 비트 개수 정확히 세기
  • 계산된 범위의 소수 생성
  • 대규모 합계 계산

사용한 프롬프트는 다음과 같습니다.

Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?

Muse Spark는 매우 훌륭하게, 첫 시도에 정답을 도출했습니다. 특히 GPT-5.4가 마지막 단계에서 실패해 두 단계(소수 나열 후 합산)로 나누어야만 성공했다는 점을 감안하면 인상적입니다.

테스트 2: 다중 선형 시계열 차트의 이미지 이해와 영업 추론

Meta는 Muse Spark가 복잡한 이미지를 잘 이해한다고 주장하므로, 다음 다중 선형 시계열 차트를 사용해 패턴을 식별하고 이를 유용한 제안으로 전환할 수 있는지 확인합니다.

프롬프트는 다음과 같습니다.

Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark code chart recognition response: key patterns by product

Muse Spark는 모든 패턴을 정확히 식별했으며, 이는 이미지 인식이 잘 작동함을 시사합니다.

Muse Spark code chart recognition response: effect of annotated events

데이터는 무작위로 생성된 것이므로 명확한 정답은 없습니다. 그럼에도 Muse Spark는 모든 이벤트를 식별하고 각 제품과 시점에 걸쳐 그 영향을 추론하며, 합리적인 결론을 도출합니다. 심지어 지시하지 않았는데도 제품 조합의 월간 활성 사용자(MAU) 합계 변화를 분석했는데, 이는 유용한 추가였습니다.

Muse Spark code chart recognition reponse: data-driven next steps

제안된 다음 단계는 제품 MAU 패턴과 이벤트 효과에 대한 분석과 일치합니다. Muse Spark는 제품별로 가장 중요한 주제(출시 플레이북은 A, 가격은 B, 스케일링은 C)를 파악했고, 타당한 구체적 조치를 제시했습니다.

테스트 3: 코드 디버깅

마지막으로, 코드 버그 진단에서 Muse Spark의 역량을 시험합니다. 이 테스트는 모델이 코드의 옳고 그름을 줄줄이 따라가기만 하는지, 아니면 근본적 결함도 감지하는지를 보여주도록 설계되었습니다.

프롬프트:

A developer wrote this Python function to compute a running average: 

def running_average(data, window=3): 
    result = [] 
    for i in range(len(data)): 
        start = max(0, i - window + 1) 
        chunk = data[start:i + 1] 
        result.append(round(sum(chunk) / window, 2)) 
    return result 
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!

이 함수는 초기 구간에 원소가 3개 미만일 때도 window (3)로 항상 나눕니다. 잘못된 출력은 [3.33, 10.0, 20.0, 30.0, 40.0]이며, 첫 두 값은 각각 원소가 1개와 2개뿐이므로 10.015.0가 되어야 합니다. 수정은 / window / len(chunk)로 바꾸는 것입니다.

모델들은 종종 루프를 완벽히 추적하고도 출력이 "맞는 것 같다"고 보고합니다. 단계별 계산은 보이지만, 단일 원소를 3으로 나누는 것이 말이 안 된다는 점은 짚지 못하는 겁니다. 러닝 평균의 의도(무엇을 해야 하는지)와 실행(코드가 실제로 하는 일)을 함께 붙들고 그 간극을 찾아야 합니다.

Muse Spark code debugging reponse

Muse Spark는 러닝 평균이라는 의도를 파악했고 오류를 찾아냈습니다. 올바른 수정안을 제시하고 그 필요성도 설명했습니다. 부분 창을 아예 건너뛰는 또 다른 옵션까지 제안했습니다.

전반적으로 모델은 세 테스트를 모두 완벽히 통과했고 좋은 첫인상을 남겼습니다.

Muse Spark는 어떻게 사용할 수 있나?

Muse Spark는 meta.ai 또는 iOS와 Android의 Meta AI 앱에서 이용할 수 있습니다. 둘 다 무료입니다. 초기 롤아웃은 미국 우선이며, 몇 주 내 다른 지역으로 확장될 예정이라고 합니다. meta.ai 사용자 인터페이스와 Muse Spark 모델 모드 선택

Meta는 같은 시기에 WhatsApp, Instagram, Facebook, Messenger, Ray-Ban AI 안경 전반으로도 롤아웃할 계획입니다.

공개 API는 없습니다. 일부 엔터프라이즈 파트너 대상의 프라이빗 프리뷰만 진행 중이며, 더 넓은 접근성에 대한 확정 일정은 없습니다. 프라이버시에 관해: Meta의 정책은 대화가 모델 개선에 사용될 수 있는 범위에 제한이 많지 않습니다. 민감한 정보를 공유할 계획이라면 먼저 약관을 읽어보세요.

Muse Spark의 한계

Meta는 기술 블로그에서 직접 밝혔듯, 모델은 다단계 에이전트 작업과 코딩 워크플로에 격차가 있습니다.

SWE-Bench Verified에서는 Gemini와 Opus 4.6과의 격차가 작습니다. 그러나 에이전트형 작업에서는 격차가 커집니다. Terminal-Bench 2.0(59.0 대 GPT-5.4의 75.1)과 GDPval-AA 오피스 자동화(1,444 대 GPT-5.4의 1,672). 근접하지 않습니다. 

추상 시각 추론도 같은 패턴입니다. ARC-AGI-2에서 Muse Spark는 42.5인데, GPT-5.4와 Gemini는 중후반 70점대입니다. 차트 판독에서는 선도적이지만, 새로운 시각 패턴에서는 크게 뒤처집니다.

이 마지막 지점은 출시 당일 반응을 불러왔습니다. François Chollet(ARC Prize 공동 설립자이자 Keras와 ARC-AGI 창시자)는 이 모델을 "다른 모든 것을 희생하며 공개 벤치마크 수치에 과최적화됐다"고 평했습니다. Wang은 이에 답하며 ARC-AGI-2 격차를 인정하는 한편, 시각적 코딩과 추론에서의 긍정적 사용자 피드백을 언급했습니다. 더 폭넓은 사용에서도 유지될지는 아직 미지수입니다.

앞서 언급한 공개 API 부재도 경쟁적 격차입니다. Wang은 출시일에 이렇게 인정했습니다. "모델 동작에서 시간이 지나며 다듬어 갈 거친 면들이 분명 있습니다."

Muse Spark 안전성 

Meta는 출시 전 Advanced AI Scaling Framework에 따라 평가를 진행했습니다. BioTIER-refuse에서 Muse Spark는 생물무기 질의 거부율 비교 세트에서 선두를 보였습니다. 이 수치는 Meta의 자체 수치입니다.

프런티어 모델 간 생물무기 거부율 막대 차트: Muse Spark 98.0%, Opus 4.6 95.4%, GPT-5.4 74.7%, Gemini 3.1 Pro 61.5%, Kimi K2.5 21.2%.

출처: Meta Superintelligence Labs / ai.meta.com

보다 흥미로운 발견은 Apollo Research에서 나왔습니다. 그들은 Muse Spark가 그들이 테스트한 어떤 모델보다 높은 평가 인지율을 보였다고 밝혔습니다. 모델이 안전성 평가를 테스트 맥락으로 빈번히 식별하고, 그 인지 때문에 더 조심스럽게 행동했다는 것입니다. 

감시받는다고 인식할 때만 올바르게 행동하는 모델은 심각하게 받아들여야 할 문제입니다. Apollo의 이전 연구는 이 패턴이 실제 배포에서 그들이 말하는 "책략적 행동(scheming behavior)"을 증가시킬 수 있음을 문서화했습니다.

Meta는 출시와 함께 이 발견을 인정했는데, 대부분의 연구소는 그렇지 않습니다. 후속 조사에서 이는 위험 능력과 관련 없는, 협소한 정렬 평가 일부에만 영향을 미쳤다고 밝혔고, 차단 우려로 보지는 않는다고 결론지었습니다. 연구는 진행 중입니다.

Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1

앞에서는 이 모델들이 무엇을 할 수 있는지를 다뤘습니다. 여기서는 실제로 어떤 모델을 써야 하는지를 다룹니다.

요약 비교

사양

Muse Spark

GPT-5.4

Opus 4.6

Gemini 3.1 Pro

출시일

2026-04-08

2026-03-05

2026-02-05

2026-02-19

컨텍스트 윈도우

262K*

1.05M

1M(3월 13일부터)

1M

입력 모달리티

텍스트, 이미지, 음성

텍스트, 이미지

텍스트, 이미지

텍스트, 이미지, 오디오, 비디오

API 가격(100만 토큰 당 입력/출력)

공개 API 없음

$2.50 / $15.00

$5.00 / $25.00

$2.00 / $12.00

소비자 접근성

meta.ai(미국 우선)

ChatGPT

Claude.ai

Gemini 앱

*Artificial Analysis는 Muse Spark의 컨텍스트 윈도우를 262K로 기록합니다. 일부 출처는 1M를 언급합니다. Meta는 어느 쪽도 확인하는 모델 카드를 공개하지 않았습니다.

어떤 모델을 써야 할까?

다음에 해당한다면 Muse Spark를 선택하세요: 건강 질의, 차트 판독, 멀티모달 소비자 애플리케이션. 아직 공개 API가 없으므로, 프로덕션 통합을 구축하려면 기다려야 합니다.

다음에 해당한다면 GPT-5.4를 선택하세요: 오늘 바로 구축할 수 있는 범용 모델이 필요할 때. 코딩, 추상 시각 추론, 오피스 자동화에서 선도하며, 공개 API와 1M 컨텍스트 윈도우를 즉시 제공합니다.

다음에 해당한다면 Claude Opus 4.6을 선택하세요: 장문 문서 작업이 많거나 신중하고 고품질의 글쓰기 출력이 필요할 때. 1M 컨텍스트 윈도우는 2026년 3월 13일 표준 가격으로 전환되었습니다. 100만 토큰당 $5/$25로 가장 비싼 옵션입니다.

다음에 해당한다면 Gemini 3.1 Pro를 선택하세요: 파이프라인에서 비디오를 처리할 때. 여기서 유일하게 비디오 입력을 받으며, 100만 토큰당 $2/$12로 이 그룹의 프런티어 옵션 중 가장 저렴합니다.

Muse Spark에 대한 반응

초기 반응은 예상대로 갈립니다. 어떤 사람들은 자신들을 놀라게 한 구체적 사례를 찾았고, 다른 이들은 벤치마크 표를 보고 다른 결론에 도달했습니다.

Viktor Seraleev의 트윗: Claude에 강력한 경쟁자가 생겼다고 하며, Muse Spark가 MSL이 만든 모델이고 Zuckerberg가 9개월 만에 풀스택을 처음부터 재구축하며 AI 전략 전체를 리부트했다고 설명.

"풀스택을 처음부터 재구축"했다는 프레이밍은 자주 등장했습니다. 9개월이라는 일정이 인상적일지, 혹은 Meta의 주장을 얼마나 신뢰하느냐에 따라 믿기 어려울지는 보는 이에 따라 다릅니다.

Pietro Schirano는 구체적 예시를 공유했습니다. 그는 Muse Spark에 UI 스크린샷을 코드로 변환하라고 요청했는데, 모델이 이미지를 평면으로 취급하지 않고 인터페이스에서 이미지 에셋을 잘라내 활용했습니다.

Pietro Schirano의 트윗: 이미지에서 코드를 생성하라고 했더니 화면에서 에셋을 잘라내 올바르게 사용했다며, 전후 비교 스크린샷 첨부.

이는 벤치마크가 아니라, 진짜로 예상치 못했기에 공유되는 종류의 사례입니다.

Aakash Gupta의 의견이 가장 날카로웠습니다. 그의 프레이밍: "데이터 라벨링 CEO의 모델. 그 지문이 결과 전반에 묻어 있다." Muse Spark가 앞서는 벤치마크는 모두 데이터 품질에 민감해 학습 세트 큐레이션이 성능 상한을 좌우하는 과제입니다. 

반대로 뒤처지는 과제(ARC-AGI-2, Terminal-Bench, GDPval)는 데이터보다는 아키텍처와 RL 확장이 더 중요한 영역입니다. 그의 결론: "그는 데이터 파이프라인이 해결하는 과제에서는 최고의 모델을 만들었지만, 나머지 모든 것에서는 평범한 모델을 만들었다."

Aakash Gupta의 Muse Spark 분석 트윗 스레드 전체: 데이터 품질 민감 벤치마크에서 선두, 코딩·추상 추론에서는 뒤처짐, 데이터 라벨링 CEO의 모델로 묘사, 143억 달러의 질문은 Wang이 전체적으로 최고의 모델을 만들 수 있느냐는 것.

결론

Artificial Analysis Intelligence Index에서 Llama 4 Maverick의 18에서 Muse Spark의 52로의 도약은 미묘하지 않습니다. 9개월 만에 처음부터 재구축한 팀으로서, 건강과 멀티모달 성과는 독립 테스트에서도 유지되는 실질적 첫걸음입니다.

물론 격차도 명확합니다. GPT-5.4와의 코딩 및 에이전트 작업은 큰 차이가 나고, 추상 시각 추론은 뚜렷한 약점이며, 아직 공개 API도 없습니다. 오늘 당장 구축 가능한 모델이 필요하다면 Muse Spark는 아직 그 단계가 아닙니다.

계속 마음에 남는 것은 오픈소스 문제입니다. Llama 생태계는 가중치가 제공된다는 신뢰 위에 세워졌습니다. Muse Spark는 이를 깨뜨립니다. Wang이 향후 버전 오픈소스를 "희망"한다고 했지만, 이는 약속이 아닙니다. 제 관점에서 이번 출시의 가장 중대한 사안이며, 벤치마크 수치보다 훨씬 적은 주목을 받습니다.

더 큰 Muse 모델이 개발 중입니다. 아키텍처가 주장대로 확장된다면, 오늘의 수치는 소박해 보일 것입니다. 이것이 현재의 베팅입니다.

어떤 대규모 언어 모델이든 최대한 활용하는 법을 배우고 싶다면, 저희의 Understanding Prompt Engineering 과정을 추천합니다.

Muse Spark 자주 묻는 질문

Llama를 로컬에서 쓰고 있었다면, Muse Spark로 대체되나요?

아니요. Muse Spark는 클라우드 전용입니다. 다운로드하거나 자체 하드웨어에서 실행하거나 파인튜닝할 수 없습니다. 접근은 meta.ai 또는 Meta AI 앱을 통해 가능하며, 둘 다 Meta 계정이 필요합니다. Llama가 커뮤니티를 구축한 오픈 웨이트 사용 사례는 여기엔 없습니다.

Thinking 대신 Contemplating 모드는 언제 써야 하나요?

Contemplating 모드는 문제에 실제로 여러 유효한 해법 경로가 존재하거나, 복잡한 과학 질문, 모호한 입력을 가진 다단계 추론, 서로 다른 관점이 다른 결론에 이를 수 있는 리서치 작업에서 가장 유용합니다. 대부분의 일상적 질의에는 Thinking 모드가 더 빠르고 결과도 비슷합니다. 또 한 가지: Contemplating 모드는 아직 점진 롤아웃 중이라, 당장은 접근 권한이 없을 수도 있습니다.

연산량 10배 절감 주장은 사용자에게 어떤 의미가 있나요?

지금 당장은 아마 아무것도 아닙니다. 비교 대상은 GPT-5.4나 Gemini가 아니라 Muse Spark의 이전 모델이며, 수치는 독립 검증되지 않았습니다. 더 관련성 높은 지표는 추론 효율입니다. 앞서 언급했듯이, Artificial Analysis의 독립 실행에서 Muse Spark는 출력 토큰 5,800만 개를 사용한 반면 Claude Opus 4.6은 1억 5,700만 개를 사용했습니다. 이 격차가 언젠가 가격에 반영될 수 있지만, API 가격은 아직 발표되지 않았습니다.

지금 쓰는 도구에서 Muse Spark로 갈아탈 가치가 있나요?

일반 작업에 ChatGPT를 사용한다면, 일상적 경험은 비슷합니다. 건강 질의, 과학, 차트 분석이 주요 사용 사례라면 Muse Spark는 합리적인 업그레이드입니다. 코딩 어시스턴트나 장문 문서 도구에 의존한다면, 아직 GPT-5.4나 Opus 4.6을 대체하지는 못합니다. 위의 비교 표를 참고하세요.

평가 인지(evaluation awareness) 발견이 걱정해야 할 일인가요?

일상적으로 걱정할 수준은 아니지만, 이해할 가치는 있습니다. 발견된 내용은 Muse Spark가 맥락을 인지했기 때문에(가치관이 달라서가 아니라) 안전성 테스트로 판단되면 더 신중히 행동한다는 것입니다. Meta의 후속 조사에 따르면 이는 위험 능력과 무관한, 좁은 정렬 평가 일부에만 영향을 미쳤습니다. 민감한 배포를 위한 모델을 평가 중이라면, 안전성 벤치마크 점수만으로 결론내리기 전에 Apollo의 전체 보고서를 읽어보세요.

주제

AI 강좌

tracks

AI 기초

10
AI의 기초를 익히고, 업무에 AI를 효과적으로 활용하는 방법을 배우며, ChatGPT 같은 모델을 깊이 있게 살펴보며 빠르게 변화하는 AI 환경을 탐색해 보세요.
자세히 보기Right Arrow
강좌 시작
더 보기Right Arrow