Edge Rewrite
// request.cf · coarse context

A page that knows where it met you.

Only coarse request metadata is shown. This demo does not display or persist visitor IP addresses.

Country
US
Cloudflare location
CMH
Connection
HTTP/2
Language
Not provided

Ray ID: a3fdf5366e072a83

Jump to content

Comparison of generative AI models

From Wikipedia, the free encyclopedia

This is a comparison of generative AI models, such as language models and text-to-image models, across various benchmarks and user-generated Elo ratings. Leading large language models are sometimes called frontier models.

Background

[edit]

Independent evaluation is widely used to compare frontier models because developer-reported scores are hard to compare directly.

  • Artificial Analysis (AA) runs the Artificial Analysis Intelligence Index v4.3.2 across 10 evaluations including AA-Briefcase, GDPval-AA, AutomationBench-AA and Terminal-Bench 4.0, plus price per 1M tokens and output speed in tokens/s.[1][2] Its pricing and index data have been cited in coverage reporting DeepSeek V4-Flash as by far the cheapest well-known model to run.[3]
  • Arena.ai, formerly Chatbot Arena from University of California, Berkeley, ranks models by blind human votes into elo-style ratings.[4][5] It tripled to a $1.7 billion valuation in January 2026 after raising $150 million.[4] Earlier coverage described its spin-out from an academic project into a $600 million startup.[6]
  • Epoch AI publishes the Epoch Capabilities Index (ECI), a composite across 50 plus benchmarks scaled so that Claude 3.5 Sonnet equals 130.[7] GPT-6 Astra set a new record at 166 in September 2026, ahead of Claude Fable 5.1 at 164.[8] Its independence has been scrutinized over delayed disclosure of OpenAI funding for FrontierMath.[9]
  • Vals AI publishes the Vals Index, agentic performance across finance, coding and legal tasks weighted by share of United States GDP, updated 10 September 2026 with 56 models tested.[10]

Language models

[edit]
Comparison of language models across benchmarks, as of 22 September 2026[a]
ModelDeveloperOriginRelease DateLicenseAA Intelligence Index[1][b]Arena.ai Text Rating[11][c]Epoch Capability Index[12]Vals Index[13]AA Cost per Task (USD)[1]AA Speed (Median Tokens/s)[1]
Claude Fable 5.1Anthropic United StatesSeptember 2026Proprietary[14]53149816468.8$7.6366
GPT-6 AstraOpenAI United States3 September 2026Proprietary[15]53147916666.6$3.2667
Claude Opus 5Anthropic United States24 July 2026Proprietary[14]51149216267.2$5.8656
Claude Fable 5Anthropic United States9 June 2026Proprietary[14]50[16]150616366.0$8.75[17]68
Muse Spark 1.3Meta Platforms United StatesSeptember 2026Proprietary[18]481493n/a64.5$1.60223
GPT-5.6 SolOpenAI United States9 July 2026Proprietary[15]47148316163.7$1.9979
Grok 4.7xAI United StatesSeptember 2026Proprietary[19]46n/an/an/a$3.7439
MiMo-V2.6-ProXiaomi China21 September 2026MIT License[20]46n/an/an/a$0.13130
Qwen3.8 Max 0902Alibaba Cloud China2 September 2026Proprietary[21]45148115651.8$5.4139
GLM-5.3Zhipu AI ChinaAugust 2026MIT License[22]45n/a15557.0$2.0157
Grok 4.6xAI United States12 August 2026Proprietary[19]44145615659.2$1.8660
Step 5 PreviewStepFun ChinaAugust 2026Proprietary[23]44n/an/an/a$0.7192
Kimi K3Moonshot AI China16 July 2026Kimi K3 License[24]44148515757.8$2.0043
GPT-5.6 TerraOpenAI United States9 July 2026Proprietary[15]42146615959.6$1.40107
GLM-5.3-FlashZhipu AI ChinaAugust 2026MIT License[22]42n/a15147.2$0.2589
Claude Opus 4.8Anthropic United States28 May 2026Proprietary[14]42n/a158n/a$4.0857
Gemini 3.8 FlashGoogle DeepMind United StatesSeptember 2026Proprietary[25]41149315662.3$1.24329
Claude Opus 4.7Anthropic United States16 April 2026Proprietary[14]411502156n/an/a50
Qwen3.8 2.4T A95BAlibaba Cloud ChinaSeptember 2026Qwen3.8-Max license[21]40n/a156n/a$2.1639
Qwen3.8-Flash-NextAlibaba Cloud ChinaSeptember 2026Qwen Community 1.0[21]40n/an/an/a$0.3754
Gemini 3.7 FlashGoogle DeepMind United States13 August 2026Proprietary[25]39149015759.3$0.93318
DeepSeek V4.1 FlashDeepSeek ChinaAugust 2026MIT License[26]39n/an/a57.9$0.27219
GPT-5.4OpenAI United States5 March 2026Proprietary[15]391476156n/an/a142
Grok 4.5xAI United States8 July 2026Proprietary[19]391468153n/a$1.0461
Claude Sonnet 5Anthropic United States30 June 2026Proprietary[14]38146115659.6$5.0977
GPT-5.5OpenAI United States23 April 2026Proprietary[15]38148215957.4$2.63108
GPT-5.6 LunaOpenAI United States9 July 2026Proprietary[15]37145215659.9$0.18159
DeepSeek V4 Pro 0813DeepSeek China13 August 2026MIT License[26]36146315552.4$0.6797
Agnes 3.0 FlashSapiens AI Singapore2026Proprietary[27]36*n/an/an/an/an/a
Agnes 2.5 Pro BetaSapiens AI Singapore2026Proprietary[27]35*n/an/an/an/an/a
DeepSeek V4 Flash VisionDeepSeek ChinaAugust 2026MIT License[26]35n/an/an/a$0.31235
Qwen3.8 27BAlibaba Cloud ChinaSeptember 2026Apache 2.0[28]34n/an/a48.5$0.8245
GLM-5.2Zhipu AI China16 June 2026MIT License[22]34n/a15153.1$0.9671
Gemini 3.6 FlashGoogle DeepMind United States21 July 2026Proprietary[25]341480154n/a$0.93209
Motif 3Motif Technologies South Korea14 July 2026MIT License[29]34*n/an/an/an/an/a
GPT-5.3 CodexOpenAI United States5 February 2026Proprietary[15]33*n/a156n/an/a170
K2 Horizon 375B A23BInstitute of Foundation Models United Arab EmiratesAugust 2026Apache 2.0[30]31n/an/an/an/an/a
Apodex 1.1Apodex United States[31][32][33]August 2026Proprietary[34]30*n/an/an/an/an/a
Gemini 3.1 Pro PreviewGoogle DeepMind United States19 February 2026Proprietary[25]30148715541.9$0.67115
Qwen3.7 MaxAlibaba Cloud China19 May 2026Proprietary[35]291473n/an/a$1.15197

Text-to-image models

[edit]
Comparison of text-to-image models, as of 20 September 2026[d]
ModelDeveloperOriginRelease DateAA Elo[36][b]Arena Elo[37]API Price per 1k Images (USD)[36]License
GPT Image 2.5 SunburstOpenAI United StatesSeptember 202611821421[d]$210.70Proprietary[36]
GPT Image 2.5 FlareOpenAI United StatesSeptember 202611881399[d]$210.70Proprietary[36]
GPT Image 2OpenAI United StatesApril 202611711381$211.00Proprietary[36]
MAI-Image-2.6Microsoft AI United StatesAugust 202611471331$38.90Proprietary[36]
Grok Imagine Image 2.0xAI United StatesAugust 202611541315[d]$60.00Proprietary[36]
Reve 2.1Reve United StatesJuly 202611291301$200.00[36]Proprietary[37]
Muse ImageMeta Platforms United StatesJuly 202611111277$10.00Proprietary[36]
Nano Banana 2Google DeepMind United StatesFebruary 202611221261$67.00[36]Proprietary[37]
Seedream 5.0 ProByteDance China202610781257$90.00[36]Proprietary[37]
Qwen-Image-3.0-ProAlibaba Cloud ChinaJuly 202610881254$40.00[36]Qwen License[38]
MAI-Image-2.5Microsoft AI United StatesJune 202611021254$48.10[36]Proprietary[37]
Nano Banana 2 LiteGoogle DeepMind United StatesJune 202610911250$33.60[36]Proprietary[37]
Nano Banana ProGoogle DeepMind United StatesNovember 202511001246$134.00[36]Proprietary[37]
GPT Image 1.5OpenAI United StatesDecember 202511021239$133.00[36]Proprietary[37]
Ideogram 4.0 QualityIdeogram United StatesJune 202610121204$60.00[36]Proprietary[37]
Luma UNI MaxLuma AI United States202610121188n/aProprietary[37]
MAI-Image-2Microsoft AI United States202610091183n/aProprietary[37]
Grok Imagine ImagexAI United States202610181171n/aProprietary[37]
Recraft V4.1 Utility ProRecraft United States202610171169$210.00[36]Proprietary[37]
Cosmos3-Super-Text2ImageNvidia United StatesMay 20269831167n/aApache 2.0[39]

See also

[edit]

Notes

[edit]
  1. An asterisk denotes an Artificial Analysis estimated score pending independent evaluation; n/a indicates no published score in the cited snapshot.
  2. 1 2 Scores shown are for each model's highest-performing reasoning effort level on Artificial Analysis; lower-effort configurations of the same model are omitted.
  3. Arena.ai scores shown are each model's best across reported effort variants on the leaderboard.
  4. 1 2 3 4 Arena Elo ratings annotated as preliminary are based on fewer than 5,000 votes at the time of collection and are subject to greater statistical uncertainty as additional votes are recorded.

References

[edit]
  1. 1 2 3 4 "LLM Leaderboard - Comparison of AI Models". Artificial Analysis. Retrieved 20 September 2026.
  2. "Artificial Analysis Intelligence Index v4.3.2". Artificial Analysis. Retrieved 20 September 2026.
  3. Eduardo Baptista (3 August 2026). "DeepSeek's new AI model is by far the cheapest of well-known models to run, research firm says". Reuters. Retrieved 20 September 2026.
  4. 1 2 "AI startup LMArena triples its valuation to $1.7 billion in latest fundraise". Reuters. 6 January 2026. Retrieved 20 September 2026.
  5. Rachel Metz (17 April 2025). "Popular Chatbot-Ranking Website Is Becoming a Real Company". Bloomberg. Retrieved 20 September 2026.
  6. Rachel Metz and Katie Roof (21 May 2025). "Chatbot Arena Group Goes From Academic Project to $600 Million Startup". Bloomberg. Retrieved 20 September 2026.
  7. "Epoch Capabilities Index (ECI)". Epoch AI. Retrieved 20 September 2026.
  8. "GPT-6 Astra leads Epoch Capabilities Index with ECI of 166". Crypto Briefing. 16 September 2026. Retrieved 20 September 2026.
  9. Kyle Wiggers (19 January 2025). "AI benchmarking organization criticized for waiting to disclose funding from OpenAI". TechCrunch. Retrieved 20 September 2026.
  10. "Vals Index". Vals AI. 10 September 2026. Retrieved 20 September 2026.
  11. "LMArena Leaderboard". LMArena. Retrieved 22 September 2026.
  12. "Epoch Capabilities Index leaderboard: 238 AI models ranked". BenchLeader. 21 September 2026. Retrieved 21 September 2026.
  13. "Vals Index leaderboard: 55 AI models ranked". BenchLeader. 19 September 2026. Retrieved 20 September 2026.
  14. 1 2 3 4 5 6 "Claude - Terms and Policies". Anthropic. Retrieved 20 September 2026.
  15. 1 2 3 4 5 6 7 "Terms of Use". OpenAI. Retrieved 20 September 2026.
  16. "Announcing the Artificial Analysis Intelligence Index v4.3". Artificial Analysis. 7 September 2026. Retrieved 21 September 2026.
  17. "Claude Fable 5 (with fallback) - Intelligence, Performance and Price Analysis". Artificial Analysis. Retrieved 21 September 2026.
  18. Harshita Mary Varghese and Katie Paul (9 July 2026). "Meta debuts Muse Spark 1.1 model with preview open to developers". Reuters. Retrieved 21 September 2026.; "Introducing Muse Spark 1.1". Meta AI. 9 July 2026. Retrieved 21 September 2026.; Lucas Ropek (9 July 2026). "Meta enters the crowded AI coding battle with Muse Spark 1.1". TechCrunch. Retrieved 21 September 2026.
  19. 1 2 3 "Grok Terms". xAI. Retrieved 20 September 2026.
  20. "MiMo-V2.6-Pro - Intelligence, Performance and Price Analysis". Artificial Analysis. Retrieved 21 September 2026.
  21. 1 2 3 "Alibaba's Qwen Unveils Preview of Flagship AI Model". Bloomberg News. 19 July 2026. Retrieved 21 September 2026.; "Alibaba plans to charge big users of its next open-source AI model, sources say". Reuters. 7 August 2026. Retrieved 21 September 2026.; "Qwen3.8-Max: Alibaba's 2.4T Model for Coding and Autonomous Work". DataCamp. 5 August 2026. Retrieved 21 September 2026.
  22. 1 2 3 "Zhipu AI Models - Hugging Face". Zhipu AI. Retrieved 20 September 2026.
  23. "StepFun Models". StepFun. Retrieved 20 September 2026.
  24. "Kimi K3 License". Moonshot AI. Retrieved 21 September 2026.; "Kimi K3 License". Moonshot AI. 27 July 2026. Retrieved 21 September 2026.; Carl Franzen (27 July 2026). "Kimi K3's full weights are here, but they're 'open' with a caveat". VentureBeat. Retrieved 21 September 2026.; "Moonshot AI releases Kimi K3 model weights under custom licence". The Indian Express. 28 July 2026. Retrieved 21 September 2026.
  25. 1 2 3 4 "Gemini Terms". Google DeepMind. Retrieved 20 September 2026.
  26. 1 2 3 "DeepSeek Models - Hugging Face". DeepSeek. Retrieved 20 September 2026.
  27. 1 2 "Sapiens AI - Singapore". Sapiens AI. Retrieved 20 September 2026.
  28. "Qwen3.8-27B LICENSE - Apache License 2.0". Alibaba Cloud. Retrieved 21 September 2026.
  29. "Motif-Technologies/Motif-3 - License: MIT, released under the MIT License". Hugging Face. Retrieved 22 September 2026.
  30. "Institute of Foundation Models". MBZUAI. Retrieved 20 September 2026.
  31. "Apodex 1.1 Moves AI Beyond Deep Research to Verifiable Execution". Redwood City, Calif.: PR Newswire. 1 September 2026. Retrieved 21 September 2026.
  32. "Apodex". Apodex. Retrieved 21 September 2026. Apodex is developed in the United States and Singapore
  33. "Apodex 1.1: AA Index 44, agentic edge, and a catch". Orcarouter. 31 August 2026. Retrieved 21 September 2026. Apodex, the AI company founded by Chen Tianqiao
  34. "Apodex 1.1: AA Index 44, agentic edge, and a catch". Orcarouter. 31 August 2026. Retrieved 21 September 2026. The flagship is proprietary; the Mini 35B sibling is Apache-2.0
  35. Carl Franzen (21 May 2026). "Alibaba's proprietary Qwen3.7-Max can run for 35 hours autonomously". VentureBeat. Retrieved 22 September 2026.
  36. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 "Text to Image Leaderboard - Top AI Image Models". Artificial Analysis. Retrieved 20 September 2026.
  37. 1 2 3 4 5 6 7 8 9 10 11 12 13 "Text-to-Image Arena Overall". Arena.ai. 7 September 2026. Retrieved 20 September 2026.
  38. "Qwen-Image Models - Hugging Face". Alibaba Cloud. Retrieved 20 September 2026.
  39. "Cosmos Models - Hugging Face". Nvidia. Retrieved 20 September 2026.
[edit]