Alibaba model benchmarks.

Compare Alibaba models across answer quality, coding, complex tasks, speed, price, and context size.

Quality

Highest overall scores

  1. 1Qwen: Qwen3.7 Max46
  2. 2Qwen: Qwen3.7 Plus39
  3. 3Qwen: Qwen3.7 Flash0

Response speed

Fastest output in this sample

  1. 1Qwen: Qwen3.7 Flash104 t/s
  2. 2Qwen: Qwen3.7 Max35 t/s
  3. 3Qwen: Qwen3.7 Plus13 t/s

Input price

Lowest price per 1M tokens

  1. 1Qwen: Qwen3.7 Flash$0.03/1M
  2. 2Qwen: Qwen3.7 Plus$0.32/1M
  3. 3Qwen: Qwen3.7 Max$1.25/1M

Highlights

Quality

Overall capability · Higher is better

Speed

Output tokens per second · Higher is better

Input price

USD per 1M tokens · Lower is better

Quality benchmarks

Compare Alibaba model capability.

Performance and price

Compare practical tradeoffs.

All Alibaba models.

3 models in the current catalogue.

Alibaba technical benchmarks.

Compare named evaluation records available for Alibaba models. Missing results remain blank rather than being estimated.

BenchmarkAreaQwen3.7 MaxQwen3.7 PlusQwen3.7 FlashSource
Intelligence IndexoverallQuality4639OpenRouter / artificial-analysis
Coding Indexcoding6655.9OpenRouter / artificial-analysis
Agentic Indexagentic30.620.8OpenRouter / artificial-analysis
GPQAGPQA Diamond92.390OpenRouter model benchmarks
Humanity's Last ExamHLE38.133.4OpenRouter model benchmarks
IFBenchIFBench80.578OpenRouter model benchmarks
τ²-Bench Telecomτ²-Bench Telecom94.793OpenRouter model benchmarks
AA-LCRAA-LCR6965OpenRouter model benchmarks
GDPval-AAGDPval-AA38.622.1OpenRouter model benchmarks
CritPtCritPt13.49.1OpenRouter model benchmarks
SciCodeSciCode48.845.5OpenRouter model benchmarks
Terminal-Bench HardTerminal-Bench Hard50.847OpenRouter model benchmarks
AA-Omniscience AccuracyAA-Omniscience Accuracy30.122.2OpenRouter model benchmarks
AA-Omniscience Non-Hallucination RateAA-Omniscience Non-Hallucination Rate77.174.5OpenRouter model benchmarks