Meta model benchmarks.

Compare Meta models across answer quality, coding, complex tasks, speed, price, and context size.

Meta

Quality

Highest overall scores

  1. 1Meta: Muse Spark 1.150.6
  2. 2Meta: Llama 4 Maverick14.3
  3. 3Meta: Llama 3.3 70B Instruct9.4

Response speed

Fastest output in this sample

  1. 1Meta: Muse Spark 1.1143 t/s
  2. 2Meta: Llama 3.3 70B Instruct104 t/s
  3. 3Meta: Llama 4 Maverick55 t/s

Input price

Lowest price per 1M tokens

  1. 1Meta: Llama 3.3 70B Instruct$0.10/1M
  2. 2Meta: Llama 4 Maverick$0.20/1M
  3. 3Meta: Muse Spark 1.1$1.25/1M

Highlights

Quality

Overall capability · Higher is better

Speed

Output tokens per second · Higher is better

Input price

USD per 1M tokens · Lower is better

Quality benchmarks

Compare Meta model capability.

Performance and price

Compare practical tradeoffs.

All Meta models.

3 models in the current catalogue.

Meta technical benchmarks.

Compare named evaluation records available for Meta models. Missing results remain blank rather than being estimated.

BenchmarkAreaMuse Spark 1.1Llama 4 MaverickLlama 3.3 70B InstructSource
Intelligence IndexoverallQuality50.614.39.4OpenRouter / artificial-analysis
Coding Indexcoding71.316.311.9OpenRouter / artificial-analysis
Agentic Indexagentic37.51.30.3OpenRouter / artificial-analysis
GPQAGPQA Diamond89.867.149.8OpenRouter model benchmarks
Humanity's Last ExamHLE45.14.84OpenRouter model benchmarks
AA-LCRAA-LCR63.34615OpenRouter model benchmarks
GDPval-AAGDPval-AA43.800OpenRouter model benchmarks
CritPtCritPt15.100OpenRouter model benchmarks
SciCodeSciCode58.233.126OpenRouter model benchmarks
AA-Omniscience AccuracyAA-Omniscience Accuracy40.624.317.9OpenRouter model benchmarks
AA-Omniscience Non-Hallucination RateAA-Omniscience Non-Hallucination Rate61.912.714.9OpenRouter model benchmarks
IFBenchIFBench4347.1OpenRouter model benchmarks
τ²-Bench Telecomτ²-Bench Telecom17.826.6OpenRouter model benchmarks
Terminal-Bench HardTerminal-Bench Hard6.83OpenRouter model benchmarks
SWE-bench ProCoding5.24OpenEvals/leaderboard-data