// Workers AI · dad joke modeWhat did the comparison of AI models say? It was a "model" citizen.
Appearance
The topic of this article may not meet Wikipedia's general notability guideline. (August 2026) |
This is a comparison of generative AI models, such as language models and text-to-image models, across various benchmarks and user-generated Elo ratings. Leading large language models are sometimes called frontier models.
Background
[edit]Independent evaluation is widely used to compare frontier models because developer-reported scores are hard to compare directly.
- Artificial Analysis (AA) runs the Artificial Analysis Intelligence Index v4.3.2 across 10 evaluations including AA-Briefcase, GDPval-AA, AutomationBench-AA and Terminal-Bench 4.0, plus price per 1M tokens and output speed in tokens/s.[1][2] Its pricing and index data have been cited in coverage reporting DeepSeek V4-Flash as by far the cheapest well-known model to run.[3]
- Arena.ai, formerly Chatbot Arena from University of California, Berkeley, ranks models by blind human votes into elo-style ratings.[4][5] It tripled to a $1.7 billion valuation in January 2026 after raising $150 million.[4] Earlier coverage described its spin-out from an academic project into a $600 million startup.[6]
- Epoch AI publishes the Epoch Capabilities Index (ECI), a composite across 50 plus benchmarks scaled so that Claude 3.5 Sonnet equals 130.[7] GPT-6 Astra set a new record at 166 in September 2026, ahead of Claude Fable 5.1 at 164.[8] Its independence has been scrutinized over delayed disclosure of OpenAI funding for FrontierMath.[9]
- Vals AI publishes the Vals Index, agentic performance across finance, coding and legal tasks weighted by share of United States GDP, updated 10 September 2026 with 56 models tested.[10]
Language models
[edit]Text-to-image models
[edit]See also
[edit]Notes
[edit]- ↑ An asterisk denotes an Artificial Analysis estimated score pending independent evaluation; n/a indicates no published score in the cited snapshot.
- 1 2 Scores shown are for each model's highest-performing reasoning effort level on Artificial Analysis; lower-effort configurations of the same model are omitted.
- ↑ Arena.ai scores shown are each model's best across reported effort variants on the leaderboard.
- 1 2 3 4 Arena Elo ratings annotated as preliminary are based on fewer than 5,000 votes at the time of collection and are subject to greater statistical uncertainty as additional votes are recorded.
References
[edit]- 1 2 3 4 "LLM Leaderboard - Comparison of AI Models". Artificial Analysis. Retrieved 20 September 2026.
- ↑ "Artificial Analysis Intelligence Index v4.3.2". Artificial Analysis. Retrieved 20 September 2026.
- ↑ Eduardo Baptista (3 August 2026). "DeepSeek's new AI model is by far the cheapest of well-known models to run, research firm says". Reuters. Retrieved 20 September 2026.
- 1 2 "AI startup LMArena triples its valuation to $1.7 billion in latest fundraise". Reuters. 6 January 2026. Retrieved 20 September 2026.
- ↑ Rachel Metz (17 April 2025). "Popular Chatbot-Ranking Website Is Becoming a Real Company". Bloomberg. Retrieved 20 September 2026.
- ↑ Rachel Metz and Katie Roof (21 May 2025). "Chatbot Arena Group Goes From Academic Project to $600 Million Startup". Bloomberg. Retrieved 20 September 2026.
- ↑ "Epoch Capabilities Index (ECI)". Epoch AI. Retrieved 20 September 2026.
- ↑ "GPT-6 Astra leads Epoch Capabilities Index with ECI of 166". Crypto Briefing. 16 September 2026. Retrieved 20 September 2026.
- ↑ Kyle Wiggers (19 January 2025). "AI benchmarking organization criticized for waiting to disclose funding from OpenAI". TechCrunch. Retrieved 20 September 2026.
- ↑ "Vals Index". Vals AI. 10 September 2026. Retrieved 20 September 2026.
- ↑ "LMArena Leaderboard". LMArena. Retrieved 22 September 2026.
- ↑ "Epoch Capabilities Index leaderboard: 238 AI models ranked". BenchLeader. 21 September 2026. Retrieved 21 September 2026.
- ↑ "Vals Index leaderboard: 55 AI models ranked". BenchLeader. 19 September 2026. Retrieved 20 September 2026.
- 1 2 3 4 5 6 "Claude - Terms and Policies". Anthropic. Retrieved 20 September 2026.
- 1 2 3 4 5 6 7 "Terms of Use". OpenAI. Retrieved 20 September 2026.
- ↑ "Announcing the Artificial Analysis Intelligence Index v4.3". Artificial Analysis. 7 September 2026. Retrieved 21 September 2026.
- ↑ "Claude Fable 5 (with fallback) - Intelligence, Performance and Price Analysis". Artificial Analysis. Retrieved 21 September 2026.
- ↑ Harshita Mary Varghese and Katie Paul (9 July 2026). "Meta debuts Muse Spark 1.1 model with preview open to developers". Reuters. Retrieved 21 September 2026.; "Introducing Muse Spark 1.1". Meta AI. 9 July 2026. Retrieved 21 September 2026.; Lucas Ropek (9 July 2026). "Meta enters the crowded AI coding battle with Muse Spark 1.1". TechCrunch. Retrieved 21 September 2026.
- 1 2 3 "Grok Terms". xAI. Retrieved 20 September 2026.
- ↑ "MiMo-V2.6-Pro - Intelligence, Performance and Price Analysis". Artificial Analysis. Retrieved 21 September 2026.
- 1 2 3 "Alibaba's Qwen Unveils Preview of Flagship AI Model". Bloomberg News. 19 July 2026. Retrieved 21 September 2026.; "Alibaba plans to charge big users of its next open-source AI model, sources say". Reuters. 7 August 2026. Retrieved 21 September 2026.; "Qwen3.8-Max: Alibaba's 2.4T Model for Coding and Autonomous Work". DataCamp. 5 August 2026. Retrieved 21 September 2026.
- 1 2 3 "Zhipu AI Models - Hugging Face". Zhipu AI. Retrieved 20 September 2026.
- ↑ "StepFun Models". StepFun. Retrieved 20 September 2026.
- ↑ "Kimi K3 License". Moonshot AI. Retrieved 21 September 2026.; "Kimi K3 License". Moonshot AI. 27 July 2026. Retrieved 21 September 2026.; Carl Franzen (27 July 2026). "Kimi K3's full weights are here, but they're 'open' with a caveat". VentureBeat. Retrieved 21 September 2026.; "Moonshot AI releases Kimi K3 model weights under custom licence". The Indian Express. 28 July 2026. Retrieved 21 September 2026.
- 1 2 3 4 "Gemini Terms". Google DeepMind. Retrieved 20 September 2026.
- 1 2 3 "DeepSeek Models - Hugging Face". DeepSeek. Retrieved 20 September 2026.
- 1 2 "Sapiens AI - Singapore". Sapiens AI. Retrieved 20 September 2026.
- ↑ "Qwen3.8-27B LICENSE - Apache License 2.0". Alibaba Cloud. Retrieved 21 September 2026.
- ↑ "Motif-Technologies/Motif-3 - License: MIT, released under the MIT License". Hugging Face. Retrieved 22 September 2026.
- ↑ "Institute of Foundation Models". MBZUAI. Retrieved 20 September 2026.
- ↑ "Apodex 1.1 Moves AI Beyond Deep Research to Verifiable Execution". Redwood City, Calif.: PR Newswire. 1 September 2026. Retrieved 21 September 2026.
- ↑ "Apodex". Apodex. Retrieved 21 September 2026.
Apodex is developed in the United States and Singapore
- ↑ "Apodex 1.1: AA Index 44, agentic edge, and a catch". Orcarouter. 31 August 2026. Retrieved 21 September 2026.
Apodex, the AI company founded by Chen Tianqiao
- ↑ "Apodex 1.1: AA Index 44, agentic edge, and a catch". Orcarouter. 31 August 2026. Retrieved 21 September 2026.
The flagship is proprietary; the Mini 35B sibling is Apache-2.0
- ↑ Carl Franzen (21 May 2026). "Alibaba's proprietary Qwen3.7-Max can run for 35 hours autonomously". VentureBeat. Retrieved 22 September 2026.
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 "Text to Image Leaderboard - Top AI Image Models". Artificial Analysis. Retrieved 20 September 2026.
- 1 2 3 4 5 6 7 8 9 10 11 12 13 "Text-to-Image Arena Overall". Arena.ai. 7 September 2026. Retrieved 20 September 2026.
- ↑ "Qwen-Image Models - Hugging Face". Alibaba Cloud. Retrieved 20 September 2026.
- ↑ "Cosmos Models - Hugging Face". Nvidia. Retrieved 20 September 2026.