{"data":{"categories":[{"id":"text","primary_source":"aa_index","sources":["lmarena_text","livebench","aa_index","superclue","epoch_eci","vals_index","vendor_card","lmarena_text_chinese","lmarena_text_coding","livebench_coding","livebench_agentic_coding","aa_speed","aa_gdpval","aa_tbench_v40","aa_mlcr"],"models":[{"name":"claude-opus-5-5","display_name":"Claude Opus 5.5","vendor":"Anthropic","origin":"intl","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[{"leaderboard":"livebench","metric":"Overall","value":"83.2","entry":"Claude 5.5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-22"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"58","entry":"Claude Opus 5.5 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"66.16","entry":"Claude Opus 5.5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-22","interval":"±1.00"},{"leaderboard":"livebench_coding","metric":"Coding","value":"89.3","entry":"Claude 5.5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-22"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"71.7","entry":"Claude 5.5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"67","entry":"Claude Opus 5.5 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"60","entry":"Claude Opus 5.5 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-22 per Anthropic's announcement (Introducing Claude Opus 5.5), the first model in the Claude 5.5 family. Artificial Analysis printed no output speed for its Claude Opus 5.5 (max with fallback) row on 2026-09-22 (the column reads --), so no speed figure is quoted; the speeds of its lower-effort rows are not substituted."},{"name":"claude-fable-5-1","display_name":"Claude Fable 5.1","vendor":"Anthropic","origin":"intl","category":"text","release_date":"2026-09-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1498","entry":"claude-fable-5.1-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench","metric":"Overall","value":"83.4","entry":"Claude Fable 5.1 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"53","entry":"Claude Fable 5.1 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"68.83","entry":"Claude Fable 5.1","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.08"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"165","entry":"Claude Fable 5.1","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(162 - 170)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1592","entry":"claude-fable-5.1-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±32"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1519","entry":"claude-fable-5.1-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±18"},{"leaderboard":"livebench_coding","metric":"Coding","value":"86.4","entry":"Claude Fable 5.1 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"66.1","entry":"Claude Fable 5.1 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"65","entry":"Claude Fable 5.1 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"62","entry":"Claude Fable 5.1 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"52","entry":"Claude Fable 5.1 (max with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"71.1","entry":"Claude Fable 5.1 (max with fallback)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-09-01 per Anthropic's announcement (Introducing Claude Fable 5.1 and Claude Mythos 5.1); on sale here since 2026-09-02. LMArena's row is the max-effort build, 5,783 votes as of 2026-09-22 and not marked preliminary; the same row on the Chinese category stands on 369 votes. Epoch's fit as read on 2026-09-22 scores it 165.00 and Claude Fable 5 163.60."},{"name":"gpt-6-astra","display_name":"GPT-6 Astra","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-09-03","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1480","entry":"gpt-6-astra-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"livebench","metric":"Overall","value":"82.2","entry":"GPT-6 Astra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"53","entry":"GPT-6 Astra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"66.61","entry":"GPT-6 Astra","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.09"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"167","entry":"GPT-6 Astra","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(163 - 172)"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1543","entry":"gpt-6-astra-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±23"},{"leaderboard":"livebench_coding","metric":"Coding","value":"80.4","entry":"GPT-6 Astra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"57.3","entry":"GPT-6 Astra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"58","entry":"GPT-6 Astra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"52","entry":"GPT-6 Astra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"59","entry":"GPT-6 Astra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"35.0","entry":"GPT-6 Astra (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-09-03 per OpenAI's announcement (GPT-6 Astra: A new generation of intelligence). LMArena added gpt-6-astra-max to its text board on 2026-09-11 per its leaderboard changelog; the row stands on 2,693 votes as of 2026-09-22, and the Chinese category carries no row for it. On sale here since 2026-09-05."},{"name":"claude-opus-5","display_name":"Claude Opus 5","vendor":"Anthropic","origin":"intl","category":"text","release_date":"2026-07-24","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1493","entry":"claude-opus-5-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"livebench","metric":"Overall","value":"80.1","entry":"Claude 5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"51","entry":"Claude Opus 5 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"67.21","entry":"Claude Opus 5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±0.98"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"163","entry":"Claude Opus 5","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(160 - 167)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1559","entry":"claude-opus-5-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1533","entry":"claude-opus-5-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench_coding","metric":"Coding","value":"81.4","entry":"Claude 5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"65.2","entry":"Claude 5 Opus Thinking Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"54","entry":"Claude Opus 5 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"60","entry":"Claude Opus 5 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"49","entry":"Claude Opus 5 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"55.6","entry":"Claude Opus 5 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"claude-fable-5","display_name":"Claude Fable 5","vendor":"Anthropic","origin":"intl","category":"text","release_date":"2026-06-09","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1506","entry":"claude-fable-5-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"83.0","entry":"Claude Fable 5 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"50","entry":"Claude Fable 5 (with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"66.04","entry":"Claude Fable 5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.03"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"164","entry":"Claude Fable 5","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(161 - 168)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1553","entry":"claude-fable-5-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±14"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1552","entry":"claude-fable-5-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench_coding","metric":"Coding","value":"86.0","entry":"Claude Fable 5 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"62.2","entry":"Claude Fable 5 Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"61","entry":"Claude Fable 5 (with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"55","entry":"Claude Fable 5 (with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"42","entry":"Claude Fable 5 (with fallback)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"64.4","entry":"Claude Fable 5 (with fallback)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Artificial Analysis marked its Claude Fable 5 (with fallback) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All. LMArena relabelled this row from claude-fable-5 to claude-fable-5-high between 2026-09-06 and 2026-09-18: the Internet Archive's copies of the board show the same model key (claude-fable-5-text) with its vote count running on from 27,189 to 30,057, so the entry follows the new label on all three LMArena text boards."},{"name":"gpt-6-sol","display_name":"GPT-6 Sol","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"48","entry":"GPT-6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"104","entry":"GPT-6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"49","entry":"GPT-6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"44","entry":"GPT-6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-22 per OpenAI's announcement (Introducing GPT-6 Sol and Luna) and the API changelog entry of the same day."},{"name":"muse-spark-1.3","display_name":"Muse Spark 1.3","vendor":"Meta","origin":"intl","category":"text","release_date":"2026-09-02","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1493","entry":"muse-spark-1.3-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±9"},{"leaderboard":"livebench","metric":"Overall","value":"81.6","entry":"Muse Spark 1.3 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"48","entry":"Muse Spark 1.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"60.31","entry":"Muse Spark 1.3","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.08"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"157","entry":"Muse Spark 1.3","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(155 - 159)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1541","entry":"muse-spark-1.3-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±34"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1537","entry":"muse-spark-1.3-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±16"},{"leaderboard":"livebench_coding","metric":"Coding","value":"81.1","entry":"Muse Spark 1.3 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"64.1","entry":"Muse Spark 1.3 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"219","entry":"Muse Spark 1.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"59","entry":"Muse Spark 1.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"33","entry":"Muse Spark 1.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"43.3","entry":"Muse Spark 1.3 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-02 per Meta AI Research's announcement (Introducing Muse Spark 1.3). Epoch, which carried no row for it as of 2026-09-05, lists it as Muse Spark 1.3 (dated 2026-09-02) in the 2026-09-22 read. LMArena added muse-spark-1.3-max to its text board on 2026-09-13 per its leaderboard changelog; the row stands on 4,723 votes as of 2026-09-22. Not on sale here as of 2026-09-22."},{"name":"gpt-5.6-sol","display_name":"GPT-5.6 Sol","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-07-09","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1483","entry":"gpt-5.6-sol-xhigh","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"81.0","entry":"GPT-5.6 Sol Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-22"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"47","entry":"GPT-5.6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"63.71","entry":"GPT-5.6 Sol","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.06"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"162","entry":"GPT-5.6 Sol","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(160 - 166)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1539","entry":"gpt-5.6-sol-xhigh","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±15"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1528","entry":"gpt-5.6-sol-xhigh","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench_coding","metric":"Coding","value":"83.9","entry":"GPT-5.6 Sol Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"56.2","entry":"GPT-5.6 Sol Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"73","entry":"GPT-5.6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"54","entry":"GPT-5.6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"40","entry":"GPT-5.6 Sol (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"26.1","entry":"GPT-5.6 Sol (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"OpenAI announced a limited partner preview of the GPT-5.6 series (Sol, Terra and Luna) on 2026-06-26 and made the models generally available on 2026-07-09, the post the preview page links as the launch; release_date follows the launch."},{"name":"grok-4.7","display_name":"Grok 4.7","vendor":"xAI","origin":"intl","category":"text","release_date":"2026-09-21","on_chinaapi":false,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"46","entry":"Grok 4.7 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"60.20","entry":"Grok 4.7","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-22","interval":"±1.08"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"39","entry":"Grok 4.7 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"60","entry":"Grok 4.7 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"26","entry":"Grok 4.7 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"15.0","entry":"Grok 4.7 (xhigh)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-21 per the vendor's announcement, which now publishes under the SpaceXAI name; the row keeps the xAI label of the earlier Grok rows. Artificial Analysis lists Grok 4.7 (xhigh) and Grok 4.7 (high), both printing 46; the xhigh row is quoted because it is the highest effort setting and the higher score before rounding (46.4 against 46.3)."},{"name":"mimo-v2.6-pro","display_name":"MiMo-V2.6-Pro","vendor":"Xiaomi","origin":"cn","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"46","entry":"MiMo-V2.6-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"55","entry":"MiMo-V2.6-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"59","entry":"MiMo-V2.6-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"35","entry":"MiMo-V2.6-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"Released and open-sourced 2026-09-22 per Xiaomi's release record (MiMo-V2.6 Series Release)."},{"name":"glm-5.3","display_name":"GLM-5.3","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-08-14","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1483","entry":"glm-5.3-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench","metric":"Overall","value":"76.1","entry":"GLM-5.3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"45","entry":"GLM-5.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"71.29","entry":"GLM-5.3(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"56.97","entry":"GLM 5.3","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-22","interval":"±1.35"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"156","entry":"GLM-5.3","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(154 - 158)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1525","entry":"glm-5.3-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±22"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1524","entry":"glm-5.3-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"livebench_coding","metric":"Coding","value":"79.0","entry":"GLM-5.3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"60.9","entry":"GLM-5.3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"53","entry":"GLM-5.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"57","entry":"GLM-5.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"42","entry":"GLM-5.3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"48.3","entry":"GLM-5.3 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-08-14; served here via Zhipu's official channels since 2026-08-18. Independent boards picked it up between the 2026-08-19 and 2026-08-26 snapshots, so the vendor's own DeepSWE figure it carried before has been replaced by their readings; the LMArena row stands on 10,960 votes as of 2026-09-22. Epoch, which carried no row for it as of 2026-09-05, lists it as GLM-5.3 (dated 2026-08-14) in the 2026-09-22 read, and SuperCLUE lists GLM-5.3(max) with an evaluation published 2026-09-10. Vals lists it as GLM 5.3, released 2026-08-18 per its model page, the date of Z.ai's release notes."},{"name":"qwen3.8-max-0902","display_name":"Qwen3.8-Max-0902","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-09-02","on_chinaapi":true,"serving_model":"qwen3.8-max","sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"45","entry":"Qwen3.8 Max (0902)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"72.62","entry":"Qwen3.8-Max-0902(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"Qwen3.8 Max (0902)","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(153 - 157)"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"39","entry":"Qwen3.8 Max (0902)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"58","entry":"Qwen3.8 Max (0902)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"39","entry":"Qwen3.8 Max (0902)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"20.0","entry":"Qwen3.8 Max (0902)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"Alibaba's 2026-09-02 snapshot of Qwen3.8-Max (alias qwen3.8-max-2026-09-02), listed on Model Studio on 2026-09-02 as an upgraded snapshot of qwen3.8-max; Epoch dates it 2026-09-01. Alibaba Cloud's update notices of 2026-09-02 (www.aliyun.com/notice/118616 and the international Model Studio notice Update Notice for Qwen3.8-Max Models) state that from 10:00 Beijing time on 2026-09-05, subject to the actual change time, the qwen3.8-max model name automatically moved to this snapshot with billing unchanged. Alibaba published no completion notice; Artificial Analysis has since marked the earlier build deprecated. This row therefore links to qwen3.8-max, the name on sale here; the same snapshot is also sold under its pinned name qwen3.8-max-0902. Artificial Analysis and Epoch list it as Qwen3.8 Max (0902), SuperCLUE as Qwen3.8-Max-0902(max) (evaluation published 2026-09-10). LMArena added qwen3.8-max-0902 only to its Code Arena (changelog, 2026-09-01), which this page does not cite, and neither LiveBench nor Vals carries a 0902 row; the 2026-08-02 build's figures on the qwen3.8-max row are not reused here."},{"name":"grok-4.6","display_name":"Grok 4.6","vendor":"xAI","origin":"intl","category":"text","release_date":"2026-08-12","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1456","entry":"grok-4.6-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench","metric":"Overall","value":"78.0","entry":"Grok 4.6","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"44","entry":"Grok 4.6 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"59.17","entry":"Grok 4.6","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.21"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"156","entry":"Grok 4.6","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(155 - 159)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1517","entry":"grok-4.6-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±18"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1506","entry":"grok-4.6-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±10"},{"leaderboard":"livebench_coding","metric":"Coding","value":"76.8","entry":"Grok 4.6","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"57.0","entry":"Grok 4.6","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"58","entry":"Grok 4.6 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"55","entry":"Grok 4.6 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"21","entry":"Grok 4.6 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"12.2","entry":"Grok 4.6 (high)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-08-12. LMArena labels this vendor SpaceXAI. Its row carried the Preliminary badge on 3,453 votes as of 2026-09-05 and no longer does (15,521 votes as of 2026-09-22)."},{"name":"kimi-k3","display_name":"Kimi K3","vendor":"Moonshot AI","origin":"cn","category":"text","release_date":"2026-07-16","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1485","entry":"kimi-k3-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"79.2","entry":"Kimi K3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"44","entry":"Kimi K3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"70.68","entry":"Kimi-K3(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"57.81","entry":"Kimi K3","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.06"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"158","entry":"Kimi K3","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(155 - 161)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1535","entry":"kimi-k3-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±16"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1538","entry":"kimi-k3-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±9"},{"leaderboard":"livebench_coding","metric":"Coding","value":"81.4","entry":"Kimi K3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"62.2","entry":"Kimi K3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"37","entry":"Kimi K3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"51","entry":"Kimi K3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"13","entry":"Kimi K3 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"38.3","entry":"Kimi K3 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"step-5-preview","display_name":"Step 5 Preview","vendor":"StepFun","origin":"cn","category":"text","release_date":"2026-09-20","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"44","entry":"Step 5 Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"83","entry":"Step 5 Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"53","entry":"Step 5 Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"33","entry":"Step 5 Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"16.7","entry":"Step 5 Preview","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"StepFun's announcement page prints no date; it says the model is released today and cites Artificial Analysis results published as of 2026-09-20, and reports dated that day already quote the release, which fixes the release date. The vendor states open weights follow on 2026-10-15."},{"name":"glm-5.3-flash","display_name":"GLM-5.3-Flash","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-08-26","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1475","entry":"glm-5.3-flash","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench","metric":"Overall","value":"71.6","entry":"GLM-5.3 Flash","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"42","entry":"GLM-5.3-Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"68.10","entry":"GLM-5.3-Flash(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"47.22","entry":"GLM 5.3 Flash","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-22","interval":"±1.45"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"152","entry":"GLM-5.3-Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(150 - 154)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1529","entry":"glm-5.3-flash","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±25"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1525","entry":"glm-5.3-flash","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"livebench_coding","metric":"Coding","value":"79.0","entry":"GLM-5.3 Flash","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"56.8","entry":"GLM-5.3 Flash","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"65","entry":"GLM-5.3-Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"57","entry":"GLM-5.3-Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"33","entry":"GLM-5.3-Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"51.1","entry":"GLM-5.3-Flash","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-08-26 per Z.ai's own release notes; the first natively multimodal model in the GLM-5 line and its low-cost tier, served here on Zhipu's official channels. LMArena, LiveBench and Artificial Analysis all picked it up within days of release; the LMArena row is a ranked one standing on 10,038 votes as of 2026-09-22, carrying neither the board's Preliminary badge nor an AutoEval marker. Epoch, SuperCLUE and Vals carried no row for it as of 2026-08-31. In the 2026-09-22 read Epoch lists it as GLM-5.3-Flash dated 2026-08-20, six days before Z.ai's release notes; the benchmark runs behind that figure are on the glm-5.3-flash model itself (Epoch's model versions glm-5.3-flash_max and glm-5.3-flash_high), so only the date differs. SuperCLUE lists GLM-5.3-Flash(max) with an evaluation published 2026-09-10, and Vals lists it as GLM 5.3 Flash, released 2026-08-26 per its model page. GLM-5.3's figures are not reused here."},{"name":"gpt-5.6-terra","display_name":"GPT-5.6 Terra","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-07-09","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1466","entry":"gpt-5.6-terra-xhigh","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"77.9","entry":"GPT-5.6 Terra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"42","entry":"GPT-5.6 Terra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"59.59","entry":"GPT-5.6 Terra","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.33"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"159","entry":"GPT-5.6 Terra","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(157 - 162)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1516","entry":"gpt-5.6-terra-xhigh","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±14"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1518","entry":"gpt-5.6-terra-xhigh","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench_coding","metric":"Coding","value":"78.2","entry":"GPT-5.6 Terra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"54.9","entry":"GPT-5.6 Terra Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"82","entry":"GPT-5.6 Terra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"47","entry":"GPT-5.6 Terra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"35","entry":"GPT-5.6 Terra (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"31.7","entry":"GPT-5.6 Terra (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"OpenAI announced a limited partner preview of the GPT-5.6 series (Sol, Terra and Luna) on 2026-06-26 and made the models generally available on 2026-07-09, the post the preview page links as the launch; release_date follows the launch."},{"name":"gemini-3.8-flash","display_name":"Gemini 3.8 Flash","vendor":"Google","origin":"intl","category":"text","release_date":"2026-09-02","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1493","entry":"gemini-3.8-flash-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±9"},{"leaderboard":"livebench","metric":"Overall","value":"75.8","entry":"Gemini 3.8 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"41","entry":"Gemini 3.8 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"62.25","entry":"Gemini 3.8 Flash","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.01"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"157","entry":"Gemini 3.8 Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(155 - 161)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1543","entry":"gemini-3.8-flash-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±32"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1535","entry":"gemini-3.8-flash-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±16"},{"leaderboard":"livebench_coding","metric":"Coding","value":"72.5","entry":"Gemini 3.8 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"54.2","entry":"Gemini 3.8 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"297","entry":"Gemini 3.8 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"46","entry":"Gemini 3.8 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"20","entry":"Gemini 3.8 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"21.7","entry":"Gemini 3.8 Flash (high)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-09-02 per Google's announcement (Introducing Gemini 3.8 Flash and 3.8 Flash Cyber). LMArena marks the row preliminary (5,076 votes as of 2026-09-22). Epoch, which carried no row for it as of 2026-09-05, lists it as Gemini 3.8 Flash (dated 2026-09-02) in the 2026-09-22 read. Confirmed on sale in the public catalogue read on 2026-09-12."},{"name":"muse-spark-1.2","display_name":"Muse Spark 1.2","vendor":"Meta","origin":"intl","category":"text","release_date":"2026-08-05","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1500","entry":"muse-spark-1.2 (xHigh)","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±11"},{"leaderboard":"livebench","metric":"Overall","value":"78.0","entry":"Muse Spark 1.2 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"40","entry":"Muse Spark 1.2 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"57.05","entry":"Muse Spark 1.2","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.12"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"Muse Spark 1.2","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(153 - 158)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1528","entry":"muse-spark-1.2 (xHigh)","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±38"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1536","entry":"muse-spark-1.2 (xHigh)","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±20"},{"leaderboard":"livebench_coding","metric":"Coding","value":"77.5","entry":"Muse Spark 1.2 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"57.6","entry":"Muse Spark 1.2 xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"172","entry":"Muse Spark 1.2 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"49","entry":"Muse Spark 1.2 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"7","entry":"Muse Spark 1.2 (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"31.1","entry":"Muse Spark 1.2 (xhigh)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Epoch added a Muse Spark 1.2 row (dated 2026-08-05) between the 2026-08-31 and 2026-09-05 snapshots. Artificial Analysis marked its Muse Spark 1.2 (xhigh) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"qwen3.8-2.4t-a95b","display_name":"Qwen3.8-2.4T-A95B","vendor":"Alibaba","origin":"cn","category":"text","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"40","entry":"Qwen3.8 2.4T A95B","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"38","entry":"Qwen3.8 2.4T A95B","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"55","entry":"Qwen3.8 2.4T A95B","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"11","entry":"Qwen3.8 2.4T A95B","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"0.0","entry":"Qwen3.8 2.4T A95B","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"The open-weight Qwen3.8-2.4T-A95B release has its own Artificial Analysis row. Qwen identifies Qwen3.8-Max as a production version based on this model with additional features; the two catalogue models remain separate here, and Max scores from other boards are not reused. Artificial Analysis prints MLCR-AA 0.0 for this release, with no breakdown, against 19.4 and 20.0 for the two Qwen3.8-Max builds."},{"name":"qwen3.8-flash","display_name":"Qwen3.8-Flash","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-08-26","on_chinaapi":true,"sources":[{"leaderboard":"livebench","metric":"Overall","value":"76.2","entry":"Qwen 3.8 Flash Next","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"40","entry":"Qwen3.8-Flash-Next","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"66.41","entry":"Qwen3.8-Flash(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"livebench_coding","metric":"Coding","value":"72.6","entry":"Qwen 3.8 Flash Next","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"61.6","entry":"Qwen 3.8 Flash Next","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"54","entry":"Qwen3.8-Flash-Next","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"56","entry":"Qwen3.8-Flash-Next","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"25","entry":"Qwen3.8-Flash-Next","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"The boards list this model under its open-weight release name, Qwen3.8-Flash-Next (released 2026-08-26 per the Qwen team). The vendor's announcement states that the production version, with a 1M default context and built-in tools, is served under the name Qwen3.8-Flash, which is the qwen3.8-flash API on sale here since 2026-09-04; the two rows are joined on that statement, not on the row name. Artificial Analysis now prints 40 without an estimated marker (read 2026-09-21). SuperCLUE lists it under the API name itself, Qwen3.8-Flash(max), evaluated through the API with an evaluation published 2026-09-10, so that figure needs no join. Neither Epoch, LMArena nor Vals carried a row as of 2026-09-05."},{"name":"qwen3.8-max","display_name":"Qwen3.8-Max","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-08-02","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1481","entry":"qwen3.8-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench","metric":"Overall","value":"78.5","entry":"Qwen 3.8 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"40","entry":"Qwen3.8 Max","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"71.48","entry":"Qwen3.8-Max(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"51.84","entry":"Qwen 3.8 Max","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.29"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"157","entry":"Qwen 3.8 Max","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(155 - 159)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1538","entry":"qwen3.8-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±18"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1522","entry":"qwen3.8-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±9"},{"leaderboard":"livebench_coding","metric":"Coding","value":"72.9","entry":"Qwen 3.8 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"64.6","entry":"Qwen 3.8 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"38","entry":"Qwen3.8 Max","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"55","entry":"Qwen3.8 Max","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"19","entry":"Qwen3.8 Max","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"19.4","entry":"Qwen3.8 Max","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"The 2026-08-02 build of Qwen3.8-Max (Artificial Analysis dates it 2026-08-03), which replaced Qwen3.8-Max-Preview (retired 2026-08-05). Its release_date follows Epoch, which re-dated this build from 2026-07-19, the Preview's announcement at WAIC, to 2026-08-02 between its 2026-08-25 and 2026-09-03 releases; Model Studio listed qwen3.8-max on 2026-08-02 as well. Alibaba Cloud's update notices of 2026-09-02 (www.aliyun.com/notice/118616 and the international Model Studio notice Update Notice for Qwen3.8-Max Models) state that from 10:00 Beijing time on 2026-09-05, subject to the actual change time, the qwen3.8-max model name automatically moved to the qwen3.8-max-0902 snapshot with billing unchanged. The name on sale here therefore now serves the Qwen3.8-Max-0902 row, and Model Studio lists no snapshot ID for this build, so it can no longer be called there. Every figure on this row belongs to this build: Artificial Analysis's Qwen3.8 Max (slug qwen3-8-max-0803), Epoch's Qwen 3.8 Max (dated 2026-08-02), SuperCLUE's Qwen3.8-Max(max) (evaluation published 2026-08-06), LMArena's qwen3.8-max (added to its Text Arena on 2026-08-02 per its changelog), LiveBench's Qwen 3.8 Max (quoted at the same figures since 2026-08-10, before the snapshot existed) and Vals's Qwen 3.8 Max (released 2026-08-03 per its model page). Artificial Analysis marked its Qwen3.8 Max row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"deepseek-v4-1-flash","display_name":"DeepSeek V4.1 Flash","vendor":"DeepSeek","origin":"cn","category":"text","release_date":"2026-09-10","on_chinaapi":true,"serving_model":"deepseek-flash","sources":[{"leaderboard":"livebench","metric":"Overall","value":"81.1","entry":"DeepSeek V4.1 Flash Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"39","entry":"DeepSeek V4.1 Flash (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"71.81","entry":"DeepSeek-V4.1-Flash(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"57.86","entry":"DeepSeek V4.1 Flash","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.16"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"DeepSeek V4.1 Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(149 - 158)"},{"leaderboard":"livebench_coding","metric":"Coding","value":"80.0","entry":"DeepSeek V4.1 Flash Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"77.3","entry":"DeepSeek V4.1 Flash Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"220","entry":"DeepSeek V4.1 Flash (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"55","entry":"DeepSeek V4.1 Flash (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"27","entry":"DeepSeek V4.1 Flash (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"22.8","entry":"DeepSeek V4.1 Flash (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-10 per DeepSeek's official announcement and served by the canonical deepseek-flash API model. The vendor retired V4 Flash and V4 Flash Vision Exp that day and temporarily routes their old identifiers to V4.1 Flash; their historical leaderboard rows remain separate and none of their figures are reused here. Artificial Analysis, LiveBench and Vals all published distinct V4.1 Flash rows by 2026-09-12; Epoch (DeepSeek V4.1 Flash, dated 2026-09-09) and SuperCLUE (DeepSeek-V4.1-Flash(max), evaluation published 2026-09-11) carry one as of the 2026-09-22 read."},{"name":"gemini-3.7-flash","display_name":"Gemini 3.7 Flash","vendor":"Google","origin":"intl","category":"text","release_date":"2026-08-13","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1490","entry":"gemini-3.7-flash-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench","metric":"Overall","value":"78.8","entry":"Gemini 3.7 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"39","entry":"Gemini 3.7 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"59.31","entry":"Gemini 3.7 Flash","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.06"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"158","entry":"Gemini 3.7 Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(156 - 161)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1556","entry":"gemini-3.7-flash-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±30"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1521","entry":"gemini-3.7-flash-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±15"},{"leaderboard":"livebench_coding","metric":"Coding","value":"78.9","entry":"Gemini 3.7 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"58.3","entry":"Gemini 3.7 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"281","entry":"Gemini 3.7 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"44","entry":"Gemini 3.7 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"14","entry":"Gemini 3.7 Flash (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"15.0","entry":"Gemini 3.7 Flash (high)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-08-13. LMArena marks the row preliminary (5,640 votes as of 2026-09-22). Artificial Analysis marked its Gemini 3.7 Flash (high) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"grok-4.5","display_name":"Grok 4.5","vendor":"xAI","origin":"intl","category":"text","release_date":"2026-07-08","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1468","entry":"grok-4.5","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"75.8","entry":"Grok 4.5","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"39","entry":"Grok 4.5 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"51.53","entry":"Grok 4.5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.32"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"154","entry":"Grok 4.5","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(152 - 156)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1512","entry":"grok-4.5","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±14"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1518","entry":"grok-4.5","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench_coding","metric":"Coding","value":"68.6","entry":"Grok 4.5","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"56.5","entry":"Grok 4.5","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"55","entry":"Grok 4.5 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"44","entry":"Grok 4.5 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"11","entry":"Grok 4.5 (high)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"15.0","entry":"Grok 4.5 (high)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"LMArena labels this vendor SpaceXAI. Artificial Analysis marked its Grok 4.5 (high) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All. Released 2026-07-08 per xAI's announcement as published that day and its API release notes; the live announcement page now shows Jul 16, the date it was edited when the model reached the EU."},{"name":"gpt-5.6-luna","display_name":"GPT-5.6 Luna","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-07-09","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1452","entry":"gpt-5.6-luna-xhigh","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"73.6","entry":"GPT-5.6 Luna Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"37","entry":"GPT-5.6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"59.88","entry":"GPT-5.6 Luna","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.09"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"156","entry":"GPT-5.6 Luna","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(154 - 159)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1476","entry":"gpt-5.6-luna-xhigh","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±14"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1498","entry":"gpt-5.6-luna-xhigh","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench_coding","metric":"Coding","value":"82.9","entry":"GPT-5.6 Luna Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"48.4","entry":"GPT-5.6 Luna Max Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"144","entry":"GPT-5.6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"47","entry":"GPT-5.6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"12","entry":"GPT-5.6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"19.4","entry":"GPT-5.6 Luna (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"The low-cost tier of the GPT-5.6 line. OpenAI announced a limited partner preview of the GPT-5.6 series (Sol, Terra and Luna) on 2026-06-26 and made the models generally available on 2026-07-09, the post the preview page links as the launch; release_date follows the launch."},{"name":"gpt-6-luna","display_name":"GPT-6 Luna","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"37","entry":"GPT-6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"157","entry":"GPT-6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"43","entry":"GPT-6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"13","entry":"GPT-6 Luna (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"Released 2026-09-22 per OpenAI's announcement (Introducing GPT-6 Sol and Luna) and the API changelog entry of the same day."},{"name":"agnes-3.0-flash","display_name":"Agnes 3.0 Flash","vendor":"Agnes AI","origin":"cn","category":"text","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"36*","entry":"Agnes 3.0 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"53","entry":"Agnes 3.0 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"7","entry":"Agnes 3.0 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"}],"notes":"Artificial Analysis lists Agnes 3.0 Flash separately from the 2.5 family. Its Intelligence Index is currently estimated, so the trailing * is retained exactly as the board prints it. Artificial Analysis no longer printed an output-speed value for this row on 2026-09-21 (the column reads --), so the 238 tokens/s figure was removed rather than retained without a live source; the index, GDPval-AA and Terminal-Bench figures are from the 2026-09-21 board read."},{"name":"deepseek-v4-pro-0813","display_name":"DeepSeek V4 Pro 0813","vendor":"DeepSeek","origin":"cn","category":"text","release_date":"2026-08-13","on_chinaapi":true,"serving_model":"deepseek-v4-pro","sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1463","entry":"deepseek-v4-pro-high-20260813","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench","metric":"Overall","value":"77.4","entry":"DeepSeek V4 Pro 0813","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"36","entry":"DeepSeek V4 Pro 0813 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"70.10","entry":"DeepSeek-V4-Pro-0813(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"52.37","entry":"DeepSeek V4 Pro 0813","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.14"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"DeepSeek V4 Pro 0813","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(154 - 157)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1494","entry":"deepseek-v4-pro-high-20260813","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±25"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1503","entry":"deepseek-v4-pro-high-20260813","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"livebench_coding","metric":"Coding","value":"77.2","entry":"DeepSeek V4 Pro 0813","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"54.9","entry":"DeepSeek V4 Pro 0813","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"68","entry":"DeepSeek V4 Pro 0813 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"47","entry":"DeepSeek V4 Pro 0813 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"14","entry":"DeepSeek V4 Pro 0813 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"17.8","entry":"DeepSeek V4 Pro 0813 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"DeepSeek's change log dates this build's GA release to 2026-08-13 and states that the deepseek-v4-pro model name now serves it. Epoch added a DeepSeek V4 Pro 0813 row between the 2026-08-26 and 2026-08-31 snapshots, so the undated DeepSeek-V4-Pro figure is no longer borrowed for it. LMArena's 0813 row stands on 9,008 human votes as of 2026-09-22. SuperCLUE announced on 2026-08-26 that it had added the official DeepSeek-V4-Pro; in the July 2026 edition's data file read on 2026-09-22 that row is labelled DeepSeek-V4-Pro-0813(max), with an evaluation published 2026-08-18, and the 64.40 row the board had labelled DeepSeek-V4-Pro(max) 预览版, now plain DeepSeek-V4-Pro(max), is the preview build, quoted on the deepseek-v4-pro row rather than here."},{"name":"deepseek-v4-flash-vision-exp","display_name":"DeepSeek V4 Flash Vision Exp","vendor":"DeepSeek","origin":"cn","category":"text","release_date":"2026-08-21","on_chinaapi":false,"sources":[{"leaderboard":"livebench","metric":"Overall","value":"76.8","entry":"DeepSeek V4 Flash Vision Exp","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"35","entry":"DeepSeek V4 Flash Vision (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"livebench_coding","metric":"Coding","value":"68.2","entry":"DeepSeek V4 Flash Vision Exp","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"65.1","entry":"DeepSeek V4 Flash Vision Exp","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"231","entry":"DeepSeek V4 Flash Vision (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"52","entry":"DeepSeek V4 Flash Vision (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"12","entry":"DeepSeek V4 Flash Vision (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"}],"notes":"DeepSeek's experimental vision tier, announced in the vendor's change log on 2026-08-21 as model='deepseek-v4-flash-vision-exp'. LiveBench names its row with the vendor's -Exp suffix and Artificial Analysis drops it, but DeepSeek publishes only one vision tier, so both rows are this model. LMArena, Vals, SuperCLUE and Epoch carry no row for it, and the sibling flash figures are not reused. DeepSeek retired this tier on 2026-09-10 and its compatibility ID now routes to V4.1 Flash. It is absent from the public catalogue read on 2026-09-12 and is retained here as a historical evaluation row without an on-sale badge."},{"name":"deepseek-v4-flash-0731","display_name":"DeepSeek V4 Flash 0731","vendor":"DeepSeek","origin":"cn","category":"text","release_date":"2026-07-31","on_chinaapi":false,"sources":[{"leaderboard":"livebench","metric":"Overall","value":"74.2","entry":"DeepSeek V4 Flash 0731","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"34","entry":"DeepSeek V4 Flash 0731 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"65.60","entry":"DeepSeek-V4-Flash(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"53.57","entry":"DeepSeek V4 Flash 0731","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.21"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"DeepSeek V4 Flash 0731","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(152 - 156)"},{"leaderboard":"livebench_coding","metric":"Coding","value":"75.0","entry":"DeepSeek V4 Flash 0731","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"46.8","entry":"DeepSeek V4 Flash 0731","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"221","entry":"DeepSeek V4 Flash 0731 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"46","entry":"DeepSeek V4 Flash 0731 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"12","entry":"DeepSeek V4 Flash 0731 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"13.3","entry":"DeepSeek V4 Flash 0731 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Historical 2026-07-31 V4 Flash build. DeepSeek retired V4 Flash on 2026-09-10 and its compatibility ID now routes to V4.1 Flash; this historical score row is not the currently served build and is not marked on sale. Artificial Analysis marked its DeepSeek V4 Flash 0731 (max) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"glm-5.2","display_name":"GLM-5.2","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-06-16","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1472","entry":"glm-5.2-max","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"73.2","entry":"GLM-5.2","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"34","entry":"GLM-5.2 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"63.27","entry":"GLM-5.2(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"53.12","entry":"GLM 5.2","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.18"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"152","entry":"GLM-5.2","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(150 - 154)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1517","entry":"glm-5.2-max","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±13"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1510","entry":"glm-5.2-max","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench_coding","metric":"Coding","value":"79.7","entry":"GLM-5.2","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"51.8","entry":"GLM-5.2","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"68","entry":"GLM-5.2 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"43","entry":"GLM-5.2 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"1","entry":"GLM-5.2 (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"7.2","entry":"GLM-5.2 (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Artificial Analysis marked its GLM-5.2 (max) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"gemini-3.6-flash","display_name":"Gemini 3.6 Flash","vendor":"Google","origin":"intl","category":"text","release_date":"2026-07-21","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1480","entry":"gemini-3.6-flash-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"73.6","entry":"Gemini 3.6 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"34","entry":"Gemini 3.6 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"55.35","entry":"Gemini 3.6 Flash","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.09"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"154","entry":"Gemini 3.6 Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(153 - 156)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1536","entry":"gemini-3.6-flash-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±15"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1517","entry":"gemini-3.6-flash-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"livebench_coding","metric":"Coding","value":"77.9","entry":"Gemini 3.6 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"43.4","entry":"Gemini 3.6 Flash High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"180","entry":"Gemini 3.6 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"38","entry":"Gemini 3.6 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"7","entry":"Gemini 3.6 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"14.4","entry":"Gemini 3.6 Flash","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Artificial Analysis marked its Gemini 3.6 Flash row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"qwen3.8-27b","display_name":"Qwen3.8-27B","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-08-14","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1437","entry":"qwen3.8-27b","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench","metric":"Overall","value":"75.3","entry":"Qwen3.8 27B","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"34","entry":"Qwen3.8 27B (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"48.48","entry":"Qwen 3.8 27B","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.45"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"149","entry":"Qwen 3.8 27B","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(147 - 151)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1496","entry":"qwen3.8-27b","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±23"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1499","entry":"qwen3.8-27b","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±11"},{"leaderboard":"livebench_coding","metric":"Coding","value":"75.7","entry":"Qwen3.8 27B","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"61.4","entry":"Qwen3.8 27B","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"41","entry":"Qwen3.8 27B (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"45","entry":"Qwen3.8 27B (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"6","entry":"Qwen3.8 27B (xhigh)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"21.7","entry":"Qwen3.8 27B (xhigh)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Open-weight Qwen3.8 model, released 2026-08-14 per the Qwen team's release notes (Hugging Face and ModelScope); on sale here since 2026-09-04. Epoch, which carried no row for it as of 2026-09-05, lists it as Qwen 3.8 27B (dated 2026-08-14) in the 2026-09-22 read. Artificial Analysis lists several effort settings; the first-listed xhigh row is quoted rather than a lower-effort sibling."},{"name":"deepseek-v4-pro","display_name":"DeepSeek V4 Pro","vendor":"DeepSeek","origin":"cn","category":"text","release_date":"2026-04-24","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1457","entry":"deepseek-v4-pro","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"30","entry":"DeepSeek V4 Pro (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"64.40","entry":"DeepSeek-V4-Pro(max)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"42.89","entry":"DeepSeek V4","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.19"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"149","entry":"DeepSeek-V4-Pro","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(147 - 151)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1493","entry":"deepseek-v4-pro","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1501","entry":"deepseek-v4-pro","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"86","entry":"DeepSeek V4 Pro (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"32","entry":"DeepSeek V4 Pro (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"15","entry":"DeepSeek V4 Pro (max)","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"21.1","entry":"DeepSeek V4 Pro (max)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"The pre-0813 build; the deepseek-v4-pro API moved to DeepSeek-V4-Pro-0813 on 2026-08-12. LiveBench dropped this row in favour of the dated builds between the 2026-08-19 and 2026-08-26 snapshots, so its 71.6 is no longer quoted. SuperCLUE's DeepSeek-V4-Pro(max) row (64.40), which its July 2026 edition labelled 预览版, is quoted here from CA-971 on, overturning CA-605. CA-605 left it out because LMArena lists deepseek-v4-pro and deepseek-v4-pro-high-preview separately, but LMArena's own data gives those two rows the same checkpoint key (deepseek-v4-pro-ch1-text and deepseek-v4-pro-ch1-thinking-text) and links both to DeepSeek's 2026-04-24 announcement: they are one build in two modes, which DeepSeek's change log calls V4-Pro-Preview. Before the 2026-08-13 GA that build was the only one the deepseek-v4-pro API served, so an API evaluation published in the July edition can only be this row. SuperCLUE's data file has since dropped the 预览版 label and dates the row 2026.9.10, keeping the July figure. Artificial Analysis marked its DeepSeek V4 Pro (max) row deprecated between the 2026-09-12 and 2026-09-21 reads; the leaderboard hides such rows under its default Status: Current filter, so this row's leaderboard figures are read with the Status filter set to All."},{"name":"gemini-3.1-pro","display_name":"Gemini 3.1 Pro","vendor":"Google","origin":"intl","category":"text","release_date":"2026-02-19","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1487","entry":"gemini-3.1-pro-preview","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±3"},{"leaderboard":"livebench","metric":"Overall","value":"77.0","entry":"Gemini 3.1 Pro Preview High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"30","entry":"Gemini 3.1 Pro Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"41.90","entry":"Gemini 3.1 Pro Preview (02/26)","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.17"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"155","entry":"Gemini 3.1 Pro","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(153 - 158)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1530","entry":"gemini-3.1-pro-preview","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±8"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1520","entry":"gemini-3.1-pro-preview","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench_coding","metric":"Coding","value":"76.5","entry":"Gemini 3.1 Pro Preview High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"44.1","entry":"Gemini 3.1 Pro Preview High","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"115","entry":"Gemini 3.1 Pro Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"14","entry":"Gemini 3.1 Pro Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"4","entry":"Gemini 3.1 Pro Preview","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"15.6","entry":"Gemini 3.1 Pro Preview","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"MiniMax-M3","display_name":"MiniMax-M3","vendor":"MiniMax","origin":"cn","category":"text","release_date":"2026-06-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1441","entry":"minimax-m3","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"livebench","metric":"Overall","value":"67.3","entry":"Minimax M3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"29","entry":"MiniMax-M3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"56.90","entry":"MiniMax-M3","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"42.72","entry":"MiniMax-M3","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.20"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"147","entry":"MiniMax-M3","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(143 - 150)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1471","entry":"minimax-m3","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1496","entry":"minimax-m3","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench_coding","metric":"Coding","value":"68.2","entry":"Minimax M3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"40.7","entry":"Minimax M3","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"106","entry":"MiniMax-M3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"37","entry":"MiniMax-M3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"2","entry":"MiniMax-M3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"17.2","entry":"MiniMax-M3","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"kimi-k2.7-code","display_name":"Kimi K2.7 Code","vendor":"Moonshot AI","origin":"cn","category":"text","release_date":"2026-06-12","on_chinaapi":true,"sources":[{"leaderboard":"livebench","metric":"Overall","value":"68.4","entry":"Kimi K2.7 Code","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"26","entry":"Kimi K2.7 Code","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"150","entry":"Kimi K2.7 Code","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(148 - 152)"},{"leaderboard":"livebench_coding","metric":"Coding","value":"74.0","entry":"Kimi K2.7 Code","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"45.7","entry":"Kimi K2.7 Code","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"61","entry":"Kimi K2.7 Code","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"26","entry":"Kimi K2.7 Code","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"1","entry":"Kimi K2.7 Code","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"16.1","entry":"Kimi K2.7 Code","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"mimo-v2.5-pro","display_name":"MiMo-V2.5-Pro","vendor":"Xiaomi","origin":"cn","category":"text","release_date":"2026-04-22","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1467","entry":"mimo-v2.5-pro","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"26","entry":"MiMo-V2.5-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"53.01","entry":"MiMo-V2.5-Pro","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"40.97","entry":"MiMo V2.5 Pro","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.38"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1513","entry":"mimo-v2.5-pro","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±11"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1521","entry":"mimo-v2.5-pro","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"45","entry":"MiMo-V2.5-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"30","entry":"MiMo-V2.5-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"0","entry":"MiMo-V2.5-Pro","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"9.4","entry":"MiMo-V2.5-Pro","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":""},{"name":"hy3","display_name":"Hunyuan Hy3","vendor":"Tencent","origin":"cn","category":"text","release_date":"2026-07-06","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1456","entry":"hy3","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"25","entry":"Hy3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"62.13","entry":"Hy3(high)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1520","entry":"hy3","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±25"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1503","entry":"hy3","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±13"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"87","entry":"Hy3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"27","entry":"Hy3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"1","entry":"Hy3","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"}],"notes":""},{"name":"mimo-v2.5","display_name":"MiMo-V2.5","vendor":"Xiaomi","origin":"cn","category":"text","release_date":"2026-04-22","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1434","entry":"mimo-v2.5","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"25*","entry":"MiMo-V2.5","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"39.91","entry":"MiMo V2.5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.31"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1483","entry":"mimo-v2.5","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±13"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1491","entry":"mimo-v2.5","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"34","entry":"MiMo-V2.5","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"24","entry":"MiMo-V2.5","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"0","entry":"MiMo-V2.5","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"}],"notes":""},{"name":"qwen3.7-plus","display_name":"Qwen3.7-Plus","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-06-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1456","entry":"qwen3.7-plus","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"25","entry":"Qwen3.7 Plus","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"38.65","entry":"Qwen 3.7 Plus","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.17"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"147","entry":"Qwen3.7-Plus","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(146 - 149)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1506","entry":"qwen3.7-plus","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±13"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1501","entry":"qwen3.7-plus","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"65","entry":"Qwen3.7 Plus","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"13","entry":"Qwen3.7 Plus","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"1","entry":"Qwen3.7 Plus","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_mlcr","metric":"Medical Long Context Reasoning (%)","value":"9.4","entry":"Qwen3.7 Plus","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","retrieved_at":"2026-09-07"}],"notes":"Released 2026-06-01 (10:00 China time) per the Qwen blog, the day Model Studio also lists it; Epoch records 2026-06-02, the China-time day of the launch post on X."},{"name":"LongCat-2.0","display_name":"LongCat-2.0","vendor":"Meituan","origin":"cn","category":"text","release_date":"2026-06-30","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"19","entry":"LongCat 2.0","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"54.22","entry":"LongCat-2.0","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"18","entry":"LongCat 2.0","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_tbench_v40","metric":"Agentic Coding \u0026 Terminal Use (%)","value":"0","entry":"LongCat 2.0","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"Artificial Analysis no longer printed an output-speed value for this row on 2026-09-12, so the old figure was removed rather than retained without a live source."},{"name":"step-3.7-flash","display_name":"Step 3.7 Flash","vendor":"StepFun","origin":"cn","category":"text","release_date":"2026-05-29","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"19*","entry":"Step 3.7 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"superclue","metric":"总分 (overall)","value":"48.16","entry":"Step-3.7-Flash(high)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"193","entry":"Step 3.7 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"},{"leaderboard":"aa_gdpval","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","value":"17","entry":"Step 3.7 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"}],"notes":""},{"name":"step-3.5-flash","display_name":"Step 3.5 Flash","vendor":"StepFun","origin":"cn","category":"text","release_date":"2026-02-02","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1394","entry":"step-3.5-flash","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"aa_index","metric":"Intelligence Index","value":"17*","entry":"Step 3.5 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1435","entry":"step-3.5-flash","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±11"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1450","entry":"step-3.5-flash","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"126","entry":"Step 3.5 Flash","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"StepFun's platform documentation lists step-3.5-flash as the base version and step-3.5-flash-2603 as an agent-optimised variant built from it; the 2603 build shipped on 2026-04-02 and has its own row here. LMArena added step-3.5-flash to its text board on 2026-02-10, linking the original open weights, seven weeks before 2603 shipped, so its three text-board rows are this build (57,137 votes on the overall board as of 2026-09-22). Artificial Analysis lists this build as Step 3.5 Flash (released 2026-02-02 on its model page) and marks the row deprecated; the leaderboard hides such rows under its default Status: Current filter, so its figures are read with the Status filter set to All, and its Intelligence Index is an estimate (*). The vendor's own SWE-bench Verified figure (74.4) that stood here while no independent board was quoted has been removed. LiveBench, Epoch, Vals and SuperCLUE carry no row for it."},{"name":"step-3.5-flash-2603","display_name":"Step 3.5 Flash 2603","vendor":"StepFun","origin":"cn","category":"text","release_date":"2026-04-02","on_chinaapi":true,"sources":[{"leaderboard":"aa_index","metric":"Intelligence Index","value":"17*","entry":"Step 3.5 Flash 2603","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-21"},{"leaderboard":"aa_speed","metric":"Median output tokens/s","value":"118","entry":"Step 3.5 Flash 2603","url":"https://artificialanalysis.ai/leaderboards/models","retrieved_at":"2026-09-22"}],"notes":"StepFun's agent-optimised variant of step-3.5-flash, whose reasoning_effort takes only low and high. Released 2026-04-02 per StepFun's announcement on its X account (\"Step 3.5 Flash 2603 just shipped!\"). Artificial Analysis lists it as Step 3.5 Flash 2603 (released 2026-04-02 on its model page) and marks the row deprecated; the leaderboard hides such rows under its default Status: Current filter, so its figures are read with the Status filter set to All, and its Intelligence Index is an estimate (*). LMArena carries no 2603 row: its step-3.5-flash row is the base build and is not reused here. LiveBench, Epoch, Vals and SuperCLUE carry no row for it either."},{"name":"gpt-5.5","display_name":"GPT-5.5","vendor":"OpenAI","origin":"intl","category":"text","release_date":"2026-04-23","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1482","entry":"gpt-5.5-high","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"livebench","metric":"Overall","value":"80.2","entry":"GPT-5.5 Thinking xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"57.41","entry":"GPT 5.5","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.15"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"159","entry":"GPT-5.5","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(157 - 162)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1515","entry":"gpt-5.5-high","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±10"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1520","entry":"gpt-5.5-high","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench_coding","metric":"Coding","value":"82.1","entry":"GPT-5.5 Thinking xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"54.0","entry":"GPT-5.5 Thinking xHigh Effort","url":"https://livebench.ai/","retrieved_at":"2026-09-12"}],"notes":""},{"name":"kimi-k2.6","display_name":"Kimi K2.6","vendor":"Moonshot AI","origin":"cn","category":"text","release_date":"2026-04-20","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1460","entry":"kimi-k2.6","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±5"},{"leaderboard":"livebench","metric":"Overall","value":"70.5","entry":"Kimi K2.6 Thinking","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"43.47","entry":"Kimi K2.6","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.17"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"151","entry":"Kimi K2.6","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(149 - 153)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1526","entry":"kimi-k2.6","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±14"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1514","entry":"kimi-k2.6","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"livebench_coding","metric":"Coding","value":"78.6","entry":"Kimi K2.6 Thinking","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"46.9","entry":"Kimi K2.6 Thinking","url":"https://livebench.ai/","retrieved_at":"2026-09-12"}],"notes":""},{"name":"qwen3.6-plus","display_name":"Qwen3.6-Plus","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-04-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1443","entry":"qwen3.6-plus","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"livebench","metric":"Overall","value":"68.9","entry":"Qwen 3.6 Plus","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"31.98","entry":"Qwen 3.6 Plus","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±0.98"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"148","entry":"Qwen 3.6 Plus","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(145 - 150)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1477","entry":"qwen3.6-plus","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±13"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1495","entry":"qwen3.6-plus","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"},{"leaderboard":"livebench_coding","metric":"Coding","value":"78.2","entry":"Qwen 3.6 Plus","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"41.4","entry":"Qwen 3.6 Plus","url":"https://livebench.ai/","retrieved_at":"2026-09-12"}],"notes":""},{"name":"qwen3.7-max","display_name":"Qwen3.7-Max","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-05-20","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1473","entry":"qwen3.7-max-preview","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±10"},{"leaderboard":"livebench","metric":"Overall","value":"73.1","entry":"Qwen 3.7 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"44.77","entry":"Qwen 3.7 Max","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.08"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"154","entry":"Qwen3.7-Max","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(152 - 156)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1518","entry":"qwen3.7-max-preview","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±38"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1525","entry":"qwen3.7-max-preview","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±18"},{"leaderboard":"livebench_coding","metric":"Coding","value":"74.2","entry":"Qwen 3.7 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"},{"leaderboard":"livebench_agentic_coding","metric":"Agentic Coding","value":"43.6","entry":"Qwen 3.7 Max","url":"https://livebench.ai/","retrieved_at":"2026-09-12"}],"notes":"LMArena lists the preview build (qwen3.7-max-preview); the released model has no separate row. Released 2026-05-20 (10:00 China time) per the Qwen blog; Epoch records 2026-05-19, and the blog itself renders the date in the reader's time zone, so US readers see the 19th."},{"name":"MiniMax-M2.7","display_name":"MiniMax-M2.7","vendor":"MiniMax","origin":"cn","category":"text","release_date":"2026-03-18","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1415","entry":"minimax-m2.7","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"24.56","entry":"MiniMax-M2.7","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±0.93"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"146","entry":"MiniMax-M2.7","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(138 - 148)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1443","entry":"minimax-m2.7","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±10"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1481","entry":"minimax-m2.7","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±5"}],"notes":""},{"name":"glm-5","display_name":"GLM-5","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-02-12","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1458","entry":"glm-5","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"146","entry":"GLM-5","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(144 - 148)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1515","entry":"glm-5","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±15"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1498","entry":"glm-5","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±7"}],"notes":"Released 2026-02-12 per Z.ai's blog (GLM-5: From Vibe Coding to Agentic Engineering) and both of its release notes; Epoch records 2026-02-11, the US-time day of the launch post."},{"name":"glm-5.1","display_name":"GLM-5.1","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-04-07","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1466","entry":"glm-5.1","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"epoch_eci","metric":"General ECI","value":"150","entry":"GLM-5.1","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(148 - 152)"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1516","entry":"glm-5.1","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1513","entry":"glm-5.1","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"}],"notes":"The Vals Index V2 (2026-08-13) no longer lists this model; the V1.2 figure it once carried was removed with that revision."},{"name":"deepseek-v4-flash","display_name":"DeepSeek V4 Flash","vendor":"DeepSeek","origin":"cn","category":"text","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1436","entry":"deepseek-v4-flash","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±4"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1472","entry":"deepseek-v4-flash","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±12"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1483","entry":"deepseek-v4-flash","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±6"}],"notes":"The pre-0731 build. LMArena still lists it alongside 0731; LiveBench dropped its row between the 2026-08-19 and 2026-08-26 snapshots, so its 65.5 is no longer quoted."},{"name":"glm-5v-turbo","display_name":"GLM-5V-Turbo","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_text","metric":"Arena score (Elo)","value":"1433","entry":"glm-5v-turbo","url":"https://arena.ai/leaderboard/text","retrieved_at":"2026-09-22","interval":"±7"},{"leaderboard":"lmarena_text_chinese","metric":"Arena score (Elo)","value":"1479","entry":"glm-5v-turbo","url":"https://arena.ai/leaderboard/text/chinese","retrieved_at":"2026-09-22","interval":"±24"},{"leaderboard":"lmarena_text_coding","metric":"Arena score (Elo)","value":"1489","entry":"glm-5v-turbo","url":"https://arena.ai/leaderboard/text/coding","retrieved_at":"2026-09-22","interval":"±12"}],"notes":"Vision-language model. LMArena's text board now carries a glm-5v-turbo row (9,361 votes as of 2026-09-22); Epoch does not score it."},{"name":"doubao-seed-2-1-pro-260628","display_name":"Doubao-Seed-2.1-pro","vendor":"ByteDance","origin":"cn","category":"text","release_date":"2026-06-28","on_chinaapi":true,"sources":[{"leaderboard":"superclue","metric":"总分 (overall)","value":"65.94","entry":"Doubao-Seed-2.1-pro(high)","url":"https://www.superclueai.com/homepage","retrieved_at":"2026-09-22"},{"leaderboard":"vendor_card","metric":"Terminal Bench 2.1","value":"71.0","entry":"vendor-published figure","url":"https://seed.bytedance.com/seed2_1","retrieved_at":"2026-08-10"}],"notes":""},{"name":"hy4-preview","display_name":"Hy4-preview","vendor":"Tencent","origin":"cn","category":"text","release_date":"2026-08-28","on_chinaapi":true,"sources":[{"leaderboard":"vals_index","metric":"Accuracy (GDP-weighted finance, coding and legal)","value":"55.40","entry":"Hy4 Preview","url":"https://www.vals.ai/benchmarks/vals_index","retrieved_at":"2026-09-21","interval":"±1.25"}],"notes":"Tencent announced and open-sourced Hy4 preview on 2026-08-28. The Vals Index lists it as Hy4 Preview (tencent/hy4-preview); Artificial Analysis, LMArena, LiveBench and Epoch carried no row for it as of 2026-09-21, and those figures are left blank. Hy3 scores and AutoEval results are not attributed to this row."},{"name":"qwen3.6-flash","display_name":"Qwen3.6-Flash","vendor":"Alibaba","origin":"cn","category":"text","release_date":"2026-04-26","on_chinaapi":true,"sources":[{"leaderboard":"epoch_eci","metric":"General ECI","value":"143","entry":"Qwen 3.6 Flash","url":"https://epoch.ai/eci","retrieved_at":"2026-09-22","interval":"(141 - 145)"}],"notes":""},{"name":"agnes-2.0-flash","display_name":"Agnes 2.0 Flash","vendor":"Agnes AI","origin":"cn","category":"text","on_chinaapi":false,"sources":[{"leaderboard":"vendor_card","metric":"Claw-Eval Pass^3","value":"60.9%","entry":"vendor-published figure","url":"https://agnes-ai.com/en/docs/agnes-20-flash","retrieved_at":"2026-08-10"}],"notes":"No independent board in this snapshot covers it; the figure shown is the vendor's own. Retired from sale 2026-09-03 (CA-654): the vendor deprecated it in favour of agnes-2.5-flash; kept as a ranked row with on_chinaapi false so the roster count and maintained.at still describe the 2026-08-31 board read."},{"name":"agnes-2.5-flash","display_name":"Agnes 2.5 Flash","vendor":"Agnes AI","origin":"cn","category":"text","on_chinaapi":true,"sources":[],"notes":"Artificial Analysis carries a different build of this family (Agnes 2.5 Pro Alpha, 40) and the vendor publishes its own figures only as a chart image, so there is no number here that can be quoted."},{"name":"doubao-seed-2-1-turbo-260628","display_name":"Doubao-Seed-2.1-turbo","vendor":"ByteDance","origin":"cn","category":"text","release_date":"2026-06-28","on_chinaapi":true,"sources":[{"leaderboard":"vendor_card","metric":"Terminal Bench 2.1","value":"67.6","entry":"vendor-published figure","url":"https://seed.bytedance.com/seed2_1","retrieved_at":"2026-08-10"}],"notes":"No independent board in this snapshot covers it; the figure shown is the vendor's own. The vendor writes the name without the 260628 snapshot suffix we serve it under."},{"name":"doubao-seed-evolving","display_name":"Doubao-Seed-Evolving","vendor":"ByteDance","origin":"cn","category":"text","on_chinaapi":true,"sources":[],"notes":"Doubao publishes Seed Evolving as a rolling model under the stable doubao-seed-evolving API ID, so capabilities can change without a dated version suffix. No independent score could be verified for this exact model on the boards cited by this snapshot as of 2026-09-12; Seed 2.1 scores are not reused."},{"name":"glm-5-turbo","display_name":"GLM-5-Turbo","vendor":"Zhipu AI (Z.ai)","origin":"cn","category":"text","release_date":"2026-03-16","on_chinaapi":true,"sources":[],"notes":"No independent board in this snapshot carries a row for it."},{"name":"mimo-v2.6-flash","display_name":"MiMo-V2.6-Flash","vendor":"Xiaomi","origin":"cn","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[{"leaderboard":"vendor_card","metric":"DeepSWE v1.1","value":"65.7","entry":"vendor-published figure","url":"https://mimo.mi.com/docs/en-US/news/latest/v2-6","retrieved_at":"2026-09-22"}],"notes":"Released and open-sourced 2026-09-22 per Xiaomi's release record (MiMo-V2.6 Series Release). No independent board in this snapshot covers it; the figure shown is the vendor's own."},{"name":"mimo-v2.6-pro-ultraspeed","display_name":"MiMo-V2.6-Pro-Ultraspeed","vendor":"Xiaomi","origin":"cn","category":"text","release_date":"2026-09-22","on_chinaapi":true,"sources":[],"notes":"Xiaomi's high-speed serving mode of MiMo-V2.6-Pro, released 2026-09-22. The vendor states flagship V2.6-Pro performance at up to 20x the output speed but publishes no separate figures, and no board lists it separately, so MiMo-V2.6-Pro's scores are not reused here."}]},{"id":"image","primary_source":"lmarena_t2i","sources":["lmarena_t2i","lmarena_image_edit","aa_image_t2i","aa_image_edit"],"models":[{"name":"gpt-image-2.5-sunburst","display_name":"GPT Image 2.5 Sunburst","vendor":"OpenAI","origin":"intl","category":"image","release_date":"2026-09-08","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1421","entry":"gpt-image-2.5-sunburst","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±13","samples":3149,"preliminary":true},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1520","entry":"gpt-image-2.5-sunburst","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±9","samples":6704,"preliminary":true},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1179","entry":"GPT Image 2.5 Sunburst (max)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-11/11","samples":5159},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1167","entry":"GPT Image 2.5 Sunburst (max)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":5216}],"notes":"Both Arena rows are marked Preliminary as read on 2026-09-12: 3,149 text-to-image and 6,704 image-edit votes. Sunburst and Flare are distinct builds; their scores are not interchangeable.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"210.7","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Sunburst (max)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"210.7","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Sunburst (max)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"},{"kind":"generation_time","task":"text_to_image","value":"112.476080179214","unit":"seconds","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Sunburst (max), OpenAI","conditions":"1024×1024 or nearest supported; 1 image; 3-day median; includes download","url":"https://artificialanalysis.ai/image/models","retrieved_at":"2026-09-13"}]},{"name":"gpt-image-2.5-flare","display_name":"GPT Image 2.5 Flare","vendor":"OpenAI","origin":"intl","category":"image","release_date":"2026-09-08","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1399","entry":"gpt-image-2.5-flare","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±13","samples":2856,"preliminary":true},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1491","entry":"gpt-image-2.5-flare","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±9","samples":5676,"preliminary":true},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1187","entry":"GPT Image 2.5 Flare (max)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-11/11","samples":5236},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1145","entry":"GPT Image 2.5 Flare (max)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":5319}],"notes":"Both Arena rows are marked Preliminary as read on 2026-09-12: 2,856 text-to-image and 5,676 image-edit votes. Flare and Sunburst are distinct builds; their scores are not interchangeable.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"210.7","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Flare (max)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"210.7","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Flare (max)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"},{"kind":"generation_time","task":"text_to_image","value":"53.0124175548553","unit":"seconds","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2.5 Flare (max), OpenAI","conditions":"1024×1024 or nearest supported; 1 image; 3-day median; includes download","url":"https://artificialanalysis.ai/image/models","retrieved_at":"2026-09-13"}]},{"name":"gpt-image-2","display_name":"GPT Image 2","vendor":"OpenAI","origin":"intl","category":"image","release_date":"2026-04-21","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1381","entry":"gpt-image-2 (medium)","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1461","entry":"gpt-image-2 (medium)","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1171","entry":"GPT Image 2 (high)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-9/9","samples":15419},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1114","entry":"GPT Image 2 (high)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-9/9","samples":13425}],"notes":"Arena quotes medium quality; Artificial Analysis quotes high quality. These are different test configurations, not interchangeable scores.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"211.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2 (high)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"211.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"OpenAI","entry":"GPT Image 2 (high)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"gemini-3.1-flash-image","display_name":"Gemini 3.1 Flash Image","vendor":"Google","origin":"intl","category":"image","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1261","entry":"gemini-3.1-flash-image (nano-banana-2) [web-search]","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±5"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1387","entry":"gemini-3.1-flash-image (nano-banana-2) [web-search]","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1122","entry":"Nano Banana 2 (Gemini 3.1 Flash Image)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-8/8","samples":16711},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1103","entry":"Nano Banana 2 (Gemini 3.1 Flash Image)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-9/9","samples":13522}],"notes":"Arena identifies a web-search-enabled entry; Artificial Analysis does not identify that condition in its row label. Do not assume identical configurations.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"67.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Google","entry":"Nano Banana 2 (Gemini 3.1 Flash Image)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"67.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Google","entry":"Nano Banana 2 (Gemini 3.1 Flash Image)","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"doubao-seedream-5-0-pro-260628","display_name":"Doubao Seedream 5.0 Pro","vendor":"ByteDance","origin":"cn","category":"image","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1257","entry":"seedream-5.0-pro","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1394","entry":"seedream-5.0-pro","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1081","entry":"Seedream 5.0 Pro","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-8/8","samples":12814},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1100","entry":"Seedream 5.0 Pro","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-9/9","samples":12053}],"notes":"The 260628 Pro SKU is distinct from the 260128 Lite SKU. Scores quote the arena's seedream-5.0-pro rows, not seedream-5.0-lite.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"90.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 5.0 Pro","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"90.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 5.0 Pro","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"qwen-image-3.0-pro","display_name":"Qwen Image 3.0 Pro","vendor":"Alibaba","origin":"cn","category":"image","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1254","entry":"qwen-image-3.0-pro","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±7"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1084","entry":"Qwen-Image-3.0-Pro","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-10/10","samples":5896},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1076","entry":"Qwen-Image-3.0-Pro","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-9/9","samples":12051}],"notes":"No Qwen Image 3.0 Pro row on the Arena image-edit board as read on 2026-09-12. The qwen-image-2.0-pro-2026-06-22 row is an older build and is not reused here.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"40.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Alibaba","entry":"Qwen-Image-3.0-Pro","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"40.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Alibaba","entry":"Qwen-Image-3.0-Pro","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"flux-2-pro","display_name":"FLUX.2 Pro","vendor":"Black Forest Labs","origin":"intl","category":"image","release_date":"2025-11-25","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1154","entry":"flux-2-pro","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1245","entry":"flux-2-pro","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1009","entry":"FLUX.2 [pro]","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-8/8","samples":9794},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1006","entry":"FLUX.2 [pro]","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-7/7","samples":8015}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_image","value":"30.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Black Forest Labs","entry":"FLUX.2 [pro]","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"45.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Black Forest Labs","entry":"FLUX.2 [pro]","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"},{"kind":"generation_time","task":"text_to_image","value":"11.2778015136719","unit":"seconds","operator":"Artificial Analysis","provider":"Black Forest Labs","entry":"FLUX.2 [pro], Black Forest Labs","conditions":"1024×1024 or nearest supported; 1 image; 3-day median; includes download","url":"https://artificialanalysis.ai/image/models","retrieved_at":"2026-09-13"}]},{"name":"doubao-seedream-4-5-251128","display_name":"Doubao Seedream 4.5","vendor":"ByteDance","origin":"cn","category":"image","release_date":"2025-11-28","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1147","entry":"seedream-4.5","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1302","entry":"seedream-4.5","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±2"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"1008","entry":"Seedream 4.5","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-9/9","samples":6308},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1035","entry":"Seedream 4.5","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":4166}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_image","value":"40.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 4.5","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"40.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 4.5","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"doubao-seedream-5-0-260128","display_name":"Doubao Seedream 5.0 Lite","vendor":"ByteDance","origin":"cn","category":"image","release_date":"2026-01-28","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1138","entry":"seedream-5.0-lite","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1294","entry":"seedream-5.0-lite","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±3"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"999","entry":"Seedream 5.0 Lite","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-9/9","samples":5027},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1050","entry":"Seedream 5.0 Lite","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":4912}],"notes":"The 260128 API SKU is Seedream 5.0 Lite. Scores quote the arena's seedream-5.0-lite rows; the distinct 260628 Pro SKU has its own row. The original rank anchor is preserved.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"35.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 5.0 Lite","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"35.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Seedream 5.0 Lite","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"wan2.7-image-pro","display_name":"Wan 2.7 Image Pro","vendor":"Alibaba","origin":"cn","category":"image","release_date":"2026-04-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1103","entry":"wan2.7-image-pro","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±5"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1302","entry":"wan2.7-image-pro","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"980","entry":"Wan 2.7 Pro","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-9/9","samples":5059},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1039","entry":"Wan 2.7 Pro","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":4833}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_image","value":"64.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 2.7 Pro","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"}]},{"name":"wan2.7-image","display_name":"Wan 2.7 Image","vendor":"Alibaba","origin":"cn","category":"image","release_date":"2026-04-01","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2i","metric":"Arena score (Elo)","value":"1100","entry":"wan2.7-image","url":"https://arena.ai/leaderboard/text-to-image","retrieved_at":"2026-09-12","interval":"±5"},{"leaderboard":"lmarena_image_edit","metric":"Arena score (Elo)","value":"1301","entry":"wan2.7-image","url":"https://arena.ai/leaderboard/image-edit","retrieved_at":"2026-09-12","interval":"±4"},{"leaderboard":"aa_image_t2i","metric":"Elo","value":"977","entry":"Wan 2.7","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-9/9","samples":5029},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1033","entry":"Wan 2.7","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-9/9","samples":6291}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_image","value":"26.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 2.7","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"26.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 2.7","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"step-image-edit-2","display_name":"Step Image Edit 2","vendor":"StepFun","origin":"cn","category":"image","on_chinaapi":false,"sources":[{"leaderboard":"aa_image_t2i","metric":"Elo","value":"810","entry":"Step Image Edit 2","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13","interval":"-10/10","samples":2593},{"leaderboard":"aa_image_edit","metric":"Elo","value":"1008","entry":"Step Image Edit 2","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":4235}],"notes":"No row on the LMArena image boards at the time of this snapshot; the arena carries an older StepFun build (step1x-edit, 998) that is a different model. Artificial Analysis evidence is now quoted separately for the identified task and exact entry.","reference_metrics":[{"kind":"price","task":"text_to_image","value":"3.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"StepFun","entry":"Step Image Edit 2","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_editing","value":"3.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"StepFun","entry":"Step Image Edit 2","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"agnes-image-2.0-flash","display_name":"Agnes Image 2.0 Flash","vendor":"Agnes AI","origin":"cn","category":"image","on_chinaapi":true,"sources":[{"leaderboard":"aa_image_edit","metric":"Elo","value":"1017","entry":"Agnes Image 2.0 Flash","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13","interval":"-10/10","samples":3713}],"notes":"No row on the LMArena image boards at the time of this snapshot. Artificial Analysis evidence is now quoted separately for the identified task and exact entry.","reference_metrics":[{"kind":"price","task":"image_editing","value":"3.0","unit":"USD / 1,000 images","operator":"Artificial Analysis","provider":"Sapiens AI","entry":"Agnes Image 2.0 Flash","conditions":"1024×1024; creator API; default settings (AA pricing footnote)","url":"https://artificialanalysis.ai/image/leaderboard/editing","retrieved_at":"2026-09-13"}]},{"name":"agnes-image-2.1-flash","display_name":"Agnes Image 2.1 Flash","vendor":"Agnes AI","origin":"cn","category":"image","on_chinaapi":true,"sources":[],"notes":"No row on the LMArena image boards at the time of this snapshot."},{"name":"agnes-image-2.5-flash","display_name":"Agnes Image 2.5 Flash","vendor":"Agnes AI","origin":"cn","category":"image","on_chinaapi":true,"sources":[],"notes":"No Agnes Image 2.5 Flash row on either Arena image board as read on 2026-09-12; no independent score is substituted."},{"name":"image-01","display_name":"MiniMax image-01","vendor":"MiniMax","origin":"cn","category":"image","on_chinaapi":true,"sources":[],"notes":"No row on the LMArena image boards at the time of this snapshot."},{"name":"step-2x-large","display_name":"Step 2X Large","vendor":"StepFun","origin":"cn","category":"image","on_chinaapi":false,"sources":[],"notes":"No row on the LMArena image boards at the time of this snapshot; the arena carries an older StepFun build (step1x-edit, 998) that is a different model."}],"quality_coverage":{"models":13,"total":17,"boards":4,"operators":2}},{"id":"video","primary_source":"lmarena_t2v","sources":["lmarena_t2v","lmarena_i2v","aa_video_t2v_audio","aa_video_i2v_audio"],"models":[{"name":"gemini-omni-flash-video","display_name":"Gemini Omni Flash (video)","vendor":"Google","origin":"intl","category":"video","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1511","entry":"gemini-omni-flash","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±10"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1462","entry":"gemini-omni-flash","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±6"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1238","entry":"Gemini Omni Flash","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":16372},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1181","entry":"Gemini Omni Flash","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":11592}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"6.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Google","entry":"Gemini Omni Flash","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"6.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Google","entry":"Gemini Omni Flash","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"wan3.0-video","display_name":"Wan 3.0 Video","vendor":"Alibaba","origin":"cn","category":"video","release_date":"2026-08-13","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1494","entry":"wan3.0","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±19","samples":1167},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1481","entry":"wan3.0","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±16","samples":1401},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1242","entry":"Wan 3.0","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-9/9","samples":5746},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1178","entry":"Wan 3.0","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-8/8","samples":7876}],"notes":"Scores quote the arena's wan3.0 rows, linked to Alibaba's Wan3.0 release. Read on 2026-09-12: 1,167 text-to-video and 1,401 image-to-video votes; the reported intervals are wide. These scores are not attributed to the separate Prime SKU.","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"12.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 3.0","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"12.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 3.0","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"doubao-seedance-2-5-260628","display_name":"Doubao Seedance 2.5","vendor":"ByteDance","origin":"cn","category":"video","release_date":"2026-06-28","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1482","entry":"dreamina-seedance-2.5-720p","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±12","samples":4066},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1478","entry":"dreamina-seedance-2.5-720p","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±10","samples":6725}],"notes":"The arena entry is the 720p Dreamina build of Seedance 2.5. Read on 2026-09-12: 4,066 text-to-video and 6,725 image-to-video votes; the reported intervals remain wide."},{"name":"doubao-seedance-2-0-260128","display_name":"Doubao Seedance 2.0","vendor":"ByteDance","origin":"cn","category":"video","release_date":"2026-01-28","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1479","entry":"dreamina-seedance-2.0-720p","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±8"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1477","entry":"dreamina-seedance-2.0-720p","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±8"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1220","entry":"Dreamina Seedance 2.0 720p","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":22625},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1196","entry":"Dreamina Seedance 2.0 720p","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":17072}],"notes":"The arena entry is the 720p Dreamina build of Seedance 2.0.","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"9.07","unit":"USD / video minute","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Dreamina Seedance 2.0 720p","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"9.07","unit":"USD / video minute","operator":"Artificial Analysis","provider":"ByteDance Seed","entry":"Dreamina Seedance 2.0 720p","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"MiniMax-H3","display_name":"MiniMax H3","vendor":"MiniMax","origin":"cn","category":"video","release_date":"2026-07-31","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1462","entry":"minimax-h3","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±10"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1497","entry":"minimax-h3","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±6"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1225","entry":"MiniMax H3","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":8854},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1190","entry":"MiniMax H3","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-8/8","samples":7461}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"7.80","unit":"USD / video minute","operator":"Artificial Analysis","provider":"MiniMax","entry":"MiniMax H3","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"7.80","unit":"USD / video minute","operator":"Artificial Analysis","provider":"MiniMax","entry":"MiniMax H3","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"sora-2-pro","display_name":"Sora 2 Pro","vendor":"OpenAI","origin":"intl","category":"video","release_date":"2025-09-30","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1367","entry":"sora-2-pro","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±7"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1076","entry":"Sora 2 Pro","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-9/9","samples":4867}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"30.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"OpenAI","entry":"Sora 2 Pro","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"}]},{"name":"veo-3.1","display_name":"Veo 3.1","vendor":"Google","origin":"intl","category":"video","release_date":"2025-10-15","on_chinaapi":false,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1364","entry":"veo-3.1-audio","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±14"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1398","entry":"veo-3.1-audio","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±11"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1090","entry":"Veo 3.1","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":8976},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1088","entry":"Veo 3.1","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":8617}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"24.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Google","entry":"Veo 3.1","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"24.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Google","entry":"Veo 3.1","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"wan2.7-t2v","display_name":"Wan 2.7 T2V","vendor":"Alibaba","origin":"cn","category":"video","release_date":"2026-04-03","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1341","entry":"wan2.7-t2v","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±8"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1104","entry":"Wan 2.7","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":5986}],"notes":"","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"9.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 2.7","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"}]},{"name":"MiniMax-Hailuo-2.3","display_name":"MiniMax Hailuo 2.3","vendor":"MiniMax","origin":"cn","category":"video","release_date":"2025-10-28","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1205","entry":"hailuo-2.3","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±6"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1261","entry":"hailuo-2.3","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±5"}],"notes":""},{"name":"MiniMax-Hailuo-02","display_name":"MiniMax Hailuo 02","vendor":"MiniMax","origin":"cn","category":"video","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_t2v","metric":"Arena score (Elo)","value":"1198","entry":"hailuo-02-pro","url":"https://arena.ai/leaderboard/text-to-video","retrieved_at":"2026-09-12","interval":"±13"},{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1228","entry":"hailuo-02-pro","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±11"}],"notes":"Scores are the arena's hailuo-02-pro rows; the arena also carries standard and fast builds of the same family."},{"name":"kling-v3","display_name":"Kling v3","vendor":"Kuaishou","origin":"cn","category":"video","release_date":"2026-02-05","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1356","entry":"kling-v3-pro","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±6"},{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1108","entry":"Kling 3.0 1080p (Pro)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-5/5","samples":20826},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1076","entry":"Kling 3.0 1080p (Pro)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":16317}],"notes":"The arena entry is the pro build; the text-to-video board has no v3 row at the time of this snapshot.","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"20.16","unit":"USD / video minute","operator":"Artificial Analysis","provider":"KlingAI","entry":"Kling 3.0 1080p (Pro)","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"20.16","unit":"USD / video minute","operator":"Artificial Analysis","provider":"KlingAI","entry":"Kling 3.0 1080p (Pro)","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"},{"kind":"generation_time","task":"text_to_video_silent","value":"99.7195221020002","unit":"seconds","operator":"Artificial Analysis","provider":"fal.ai","entry":"Kling 3.0 1080p (Pro), fal.ai","conditions":"720p / 5s panel target; nearest supported settings (Kling Pro: 1080p); no audio; 3-day median; includes download","url":"https://artificialanalysis.ai/video/models","retrieved_at":"2026-09-13"}]},{"name":"kling-v3-omni","display_name":"Kling v3 Omni","vendor":"Kuaishou","origin":"cn","category":"video","release_date":"2026-02-05","on_chinaapi":true,"sources":[{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1090","entry":"Kling 3.0 Omni 1080p (Pro)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":8871},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1066","entry":"Kling 3.0 Omni 1080p (Pro)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":7665}],"notes":"No row on the LMArena video boards at the time of this snapshot. Artificial Analysis evidence is now quoted separately for the identified task and exact entry.","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"16.80","unit":"USD / video minute","operator":"Artificial Analysis","provider":"KlingAI","entry":"Kling 3.0 Omni 1080p (Pro)","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"price","task":"image_to_video_audio","value":"16.80","unit":"USD / video minute","operator":"Artificial Analysis","provider":"KlingAI","entry":"Kling 3.0 Omni 1080p (Pro)","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"wan2.7-i2v","display_name":"Wan 2.7 I2V","vendor":"Alibaba","origin":"cn","category":"video","release_date":"2026-04-03","on_chinaapi":true,"sources":[{"leaderboard":"lmarena_i2v","metric":"Arena score (Elo)","value":"1428","entry":"wan2.7-i2v","url":"https://arena.ai/leaderboard/image-to-video","retrieved_at":"2026-09-12","interval":"±5"},{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1088","entry":"Wan 2.7","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":5703}],"notes":"","reference_metrics":[{"kind":"price","task":"image_to_video_audio","value":"9.00","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba","entry":"Wan 2.7","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"happyhorse-1.1-i2v","display_name":"HappyHorse 1.1 I2V","vendor":"Alibaba","origin":"cn","category":"video","on_chinaapi":true,"sources":[{"leaderboard":"aa_video_i2v_audio","metric":"Elo","value":"1109","entry":"HappyHorse-1.1","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13","interval":"-7/7","samples":13810}],"notes":"No HappyHorse 1.1 row on the LMArena video boards as read on 2026-09-12. The arena carries the previous generation, happyhorse-1.0; that build's scores are deliberately not reused here. Artificial Analysis evidence is now quoted separately for the identified task and exact entry.","reference_metrics":[{"kind":"price","task":"image_to_video_audio","value":"9.90","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba-ATH","entry":"HappyHorse-1.1","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","retrieved_at":"2026-09-13"}]},{"name":"happyhorse-1.1-t2v","display_name":"HappyHorse 1.1 T2V","vendor":"Alibaba","origin":"cn","category":"video","on_chinaapi":true,"sources":[{"leaderboard":"aa_video_t2v_audio","metric":"Elo","value":"1146","entry":"HappyHorse-1.1","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13","interval":"-6/6","samples":18445}],"notes":"No HappyHorse 1.1 row on the LMArena video boards as read on 2026-09-12. The arena carries the previous generation, happyhorse-1.0; that build's scores are deliberately not reused here. Artificial Analysis evidence is now quoted separately for the identified task and exact entry.","reference_metrics":[{"kind":"price","task":"text_to_video_audio","value":"9.90","unit":"USD / video minute","operator":"Artificial Analysis","provider":"Alibaba-ATH","entry":"HappyHorse-1.1","conditions":"1080p; creator API; default settings (AA pricing footnote, not the quality row resolution)","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","retrieved_at":"2026-09-13"},{"kind":"generation_time","task":"text_to_video_silent","value":"107.870128135","unit":"seconds","operator":"Artificial Analysis","provider":"Alibaba Cloud (T2V)","entry":"HappyHorse-1.1, Alibaba Cloud (T2V)","conditions":"720p / 5s panel target; nearest supported settings (Kling Pro: 1080p); no audio; 3-day median; includes download","url":"https://artificialanalysis.ai/video/models","retrieved_at":"2026-09-13"}]},{"name":"kling-3.0-turbo","display_name":"Kling 3.0 Turbo","vendor":"Kuaishou","origin":"cn","category":"video","on_chinaapi":true,"sources":[],"notes":"No row on the LMArena video boards at the time of this snapshot."},{"name":"MiniMax-Hailuo-2.3-Fast","display_name":"MiniMax Hailuo 2.3 Fast","vendor":"MiniMax","origin":"cn","category":"video","release_date":"2025-10-28","on_chinaapi":true,"sources":[],"notes":"No row on the LMArena video boards at the time of this snapshot."},{"name":"wan3.0-video-prime","display_name":"Wan 3.0 Video Prime","vendor":"Alibaba","origin":"cn","category":"video","on_chinaapi":true,"sources":[],"notes":"No separately identified Wan 3.0 Prime row on either Arena video board as read on 2026-09-12. The wan3.0 row does not identify Prime, so its scores are not reused here."}],"quality_coverage":{"models":15,"total":18,"boards":4,"operators":2}}],"maintained":{"at":"2026-09-22","models":100,"sources":23},"snapshot_date":"2026-09-22","sources":[{"id":"lmarena_text","name":"LMArena Text Arena","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/text","edition":"live board","retrieved_at":"2026-09-22"},{"id":"livebench","name":"LiveBench","operator":"LiveBench (sponsored by Abacus.AI)","metric":"Overall","url":"https://livebench.ai/","edition":"LiveBench-2026-06-25","retrieved_at":"2026-09-22"},{"id":"aa_index","name":"Artificial Analysis Intelligence Index","operator":"Artificial Analysis","metric":"Intelligence Index","url":"https://artificialanalysis.ai/leaderboards/models","edition":"Intelligence Index v4.3.2, read 2026-09-22; its figures are not comparable with the v4.3 figures this page quoted from its 2026-09-12 read. v4.3.1 refreshed the pairwise judge panels of AA-Briefcase and GDPval-AA, and v4.3.2 moved GDPval-AA to v2.1 (Elo scale anchored to DeepSeek V4.1 Flash (max) at 1600, fitted with a Crowd-BT model) and refitted AA-Briefcase v1.1 with Crowd-BT, so rows moved without any model changing. v4.3 had already swapped τ³-Banking out of the index for AutomationBench-AA and Terminal-Bench v2.1 for v4.0. The leaderboard's default Status: Current filter hides rows Artificial Analysis marks deprecated; they still render with Status set to All and are re-read from that view like any other row (CA-948). A trailing * is reproduced as the board prints it: the board's data marks that score as estimated (intelligenceIndexIsEstimated), i.e. not every evaluation in the index had been run for that model","retrieved_at":"2026-09-22"},{"id":"superclue","name":"SuperCLUE 智能指数","operator":"SuperCLUE","metric":"总分 (overall)","url":"https://www.superclueai.com/homepage","edition":"2026-07 evaluation, published 2026-08-06. The homepage reads this edition from its data file (/data/generalboard/2026年7月.xlsx, sheet 总排行榜, last modified 2026-09-11), which also carries rows evaluated after publication, each with its own evaluation publication date (the latest 2026-09-11); the page's Latest Update line refers to a different sub-board","retrieved_at":"2026-09-22"},{"id":"epoch_eci","name":"Epoch Capabilities Index (ECI)","operator":"Epoch AI","metric":"General ECI","url":"https://epoch.ai/eci","edition":"live board","licence":"CC BY 4.0, as labelled on the page (https://creativecommons.org/licenses/by/4.0/)","retrieved_at":"2026-09-22"},{"id":"vals_index","name":"Vals Index","operator":"Vals AI","metric":"Accuracy (GDP-weighted finance, coding and legal)","url":"https://www.vals.ai/benchmarks/vals_index","edition":"V2 (released 2026-08-13), page states updated 9/21/2026","retrieved_at":"2026-09-22"},{"id":"vendor_card","name":"Vendor's own evaluation card","operator":"the model's own vendor","metric":"varies; the benchmark is named in each row","url":"","edition":"self-reported","self_reported":true,"retrieved_at":"2026-09-22"},{"id":"lmarena_t2i","name":"LMArena Text-to-Image Arena","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/text-to-image","edition":"live board, last updated 2026-09-07","retrieved_at":"2026-09-12","task":"text_to_image","updated_at":"2026-09-07"},{"id":"lmarena_image_edit","name":"LMArena Image Edit Arena","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/image-edit","edition":"live board, last updated 2026-09-07","retrieved_at":"2026-09-12","task":"image_editing","updated_at":"2026-09-07"},{"id":"lmarena_t2v","name":"LMArena Text-to-Video Arena","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/text-to-video","edition":"live board, last updated 2026-09-04","retrieved_at":"2026-09-12","task":"text_to_video","updated_at":"2026-09-04"},{"id":"lmarena_i2v","name":"LMArena Image-to-Video Arena","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/image-to-video","edition":"live board, last updated 2026-09-02","retrieved_at":"2026-09-12","task":"image_to_video","updated_at":"2026-09-02"},{"id":"lmarena_text_chinese","name":"LMArena Text Arena · Chinese","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/text/chinese","edition":"live board, Chinese-language category (prompts in Chinese)","retrieved_at":"2026-09-22","scene":"chinese"},{"id":"lmarena_text_coding","name":"LMArena Text Arena · Coding","operator":"LMArena (arena.ai)","metric":"Arena score (Elo)","url":"https://arena.ai/leaderboard/text/coding","edition":"live board, Coding category","retrieved_at":"2026-09-22","scene":"coding"},{"id":"livebench_coding","name":"LiveBench · Coding","operator":"LiveBench (sponsored by Abacus.AI)","metric":"Coding","url":"https://livebench.ai/","edition":"LiveBench-2026-06-25","retrieved_at":"2026-09-22","scene":"coding"},{"id":"livebench_agentic_coding","name":"LiveBench · Agentic Coding","operator":"LiveBench (sponsored by Abacus.AI)","metric":"Agentic Coding","url":"https://livebench.ai/","edition":"LiveBench-2026-06-25","retrieved_at":"2026-09-22","scene":"agentic"},{"id":"aa_speed","name":"Artificial Analysis · Output Speed","operator":"Artificial Analysis","metric":"Median output tokens/s","url":"https://artificialanalysis.ai/leaderboards/models","edition":"live board; measured by Artificial Analysis against the vendor's own API, not through ChinaAPI. Rows Artificial Analysis marks deprecated are read with the leaderboard's Status filter set to All (CA-948)","retrieved_at":"2026-09-22","scene":"speed"},{"id":"aa_gdpval","name":"Artificial Analysis · GDPval-AA v2.1","operator":"Artificial Analysis","metric":"Agentic Real-World Work Tasks, (Elo-500)/2000 (%)","url":"https://artificialanalysis.ai/leaderboards/models","edition":"GDPval-AA v2.1, live board, read 2026-09-22. 220 agentic task-completion tasks with file outputs, ranked pairwise by a panel of three frontier LLM judges; since v2.1 the Elo scale is anchored to DeepSeek V4.1 Flash (max) at 1600 and fitted with a Crowd-BT model, so its figures are not comparable with the v2 figures this page quoted from its 2026-09-12 read. The column prints clamp((Elo-500)/2000). It carries 10% of the Agents category inside Intelligence Index v4.3.2, so this column is a component of the board that orders the table, not an independent operator. Rows Artificial Analysis marks deprecated are read with the leaderboard's Status filter set to All (CA-948). The column is hidden until the leaderboard's Intelligence group is expanded","retrieved_at":"2026-09-22","scene":"agent_work"},{"id":"aa_tbench_v40","name":"Artificial Analysis · Terminal-Bench v4.0","operator":"Artificial Analysis","metric":"Agentic Coding \u0026 Terminal Use (%)","url":"https://artificialanalysis.ai/leaderboards/models","edition":"Terminal-Bench 4.0 (66 tasks), run by Artificial Analysis with the mini-swe-agent harness, pass@1 averaged over 3 repeats per task; read 2026-09-22. When this column replaced the benchmark's own board on 2026-09-07 the methodology page named the harness as mini-SWE-agent v2.4.6; on 2026-09-21 it and the evaluation page name mini-swe-agent without a version, and every figure quoted before then read back unchanged. One harness for every model, so the column compares models rather than model-plus-best-scaffold — which is why it replaced the benchmark's own board, whose rows are agent × model and covered one Chinese model out of 34 (CA-788, overturning CA-734). It carries 10% of the Coding category inside Intelligence Index v4.3.2, so this column is a component of the board that orders the table, not an independent operator. Rows Artificial Analysis marks deprecated are read with the leaderboard's Status filter set to All (CA-948). The column is hidden until the leaderboard's Intelligence group is expanded","retrieved_at":"2026-09-22","scene":"agentic"},{"id":"aa_mlcr","name":"Artificial Analysis · MLCR-AA","operator":"Artificial Analysis","metric":"Medical Long Context Reasoning (%)","url":"https://artificialanalysis.ai/evaluations/mlcr-aa","edition":"MLCR-AA, live board, read 2026-09-22. Artificial Analysis marks it a standalone evaluation that is NOT part of Intelligence Index v4.3 — unlike the GDPval-AA v2 and Terminal-Bench v4.0 columns, this one is not a component of the board that orders the table, only the same operator. The underlying benchmark is Wisedocs' open MLCR (Wisedocs-AI/medical-long-context-reasoning): synthetic medical records of roughly 25,000-64,000 tokens, graded across six tiers from locating a single fact to expert-level clinical synthesis. It measures multi-document reasoning over long records, not medical capability in general. The main leaderboard carries no column for it; the figures were first read off the evaluation page's chart (2026-09-07) and since 2026-09-22 from the per-model pages' payload, which carries every model the chart can show (CA-956)","retrieved_at":"2026-09-22","scene":"medical"},{"id":"aa_image_t2i","name":"Artificial Analysis Text To Image","operator":"Artificial Analysis","metric":"Elo","url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","edition":"live board; exact row settings retained","retrieved_at":"2026-09-13","task":"text_to_image"},{"id":"aa_image_edit","name":"Artificial Analysis Editing","operator":"Artificial Analysis","metric":"Elo","url":"https://artificialanalysis.ai/image/leaderboard/editing","edition":"live board; exact row settings retained","retrieved_at":"2026-09-13","task":"image_editing"},{"id":"aa_video_t2v_audio","name":"Artificial Analysis Text To Video · With Audio","operator":"Artificial Analysis","metric":"Elo","url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","edition":"live board; with audio pool; exact row settings retained","retrieved_at":"2026-09-13","task":"text_to_video_audio"},{"id":"aa_video_i2v_audio","name":"Artificial Analysis Image To Video · With Audio","operator":"Artificial Analysis","metric":"Elo","url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","edition":"live board; with audio pool; exact row settings retained","retrieved_at":"2026-09-13","task":"image_to_video_audio"}]},"success":true}