aider polyglot Benchmark: Scores and Sources

Published result; benchmark version and evaluation conditions remain in the id and result note.

pillar: coding · weight 1 within pillar · unit: % (higher is better) · official board ↗
Row Model Result Normalized (0–100) Confidence
1 o3-pro OpenAI 84.9%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Jun 28, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
84.9 22% confidence 22 percent, Low
2 GPT-5 OpenAI 81.3%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Aug 25, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
81.3 100% confidence 100 percent, Full
3 o3 OpenAI 76.9%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Jun 25, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
76.9 87% confidence 87 percent, High
4 o4-mini OpenAI 72%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Apr 16, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
72.0 87% confidence 87 percent, High
5 DeepSeek-R1 DeepSeek 71.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Jun 6, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
71.4 88% confidence 88 percent, High
6 Claude Opus 4 Anthropic 70.7%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished May 25, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
70.7 100% confidence 100 percent, Full
7 Claude Sonnet 3.7 Anthropic 60.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Feb 24, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
60.4 100% confidence 100 percent, Full
8 Claude Sonnet 4 Anthropic 56.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished May 24, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
56.4 100% confidence 100 percent, Full
9 DeepSeek V3 0324 DeepSeek 55.1%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Mar 24, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
55.1 74% confidence 74 percent, Medium
10 o3-mini OpenAI 53.8%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Jan 31, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
53.8 96% confidence 96 percent, High
11 GPT-4.1 OpenAI 52.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Apr 14, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
52.4 100% confidence 100 percent, Full
12 Claude Sonnet 3.5 v2 Anthropic 51.6%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Jan 17, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
51.6 100% confidence 100 percent, Full
13 GPT OSS 120B OpenAI 41.8%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Aug 6, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
41.8 79% confidence 79 percent, Medium
14 Qwen3 32B Alibaba / Qwen 40%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished May 8, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
40.0 67% confidence 67 percent, Medium
15 GPT-4.1 mini OpenAI 32.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Apr 14, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
32.4 87% confidence 87 percent, High
16 Claude Haiku 3.5 Anthropic 28%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Dec 21, 2024 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
28.0 100% confidence 100 percent, Full
17 GPT-4o (2024-08-06) OpenAI 23.1%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Dec 30, 2024 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
23.1 100% confidence 100 percent, Full
18 QwQ 32B Alibaba / Qwen 20.9%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Mar 6, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
20.9 67% confidence 67 percent, Medium
19 GPT-4o (2024-11-20) OpenAI 18.2%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Dec 30, 2024 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
18.2 61% confidence 61 percent, Medium
20 Qwen2.5-Coder-32B-Instruct Alibaba / Qwen 16.4%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Dec 26, 2024 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
16.4 90% confidence 90 percent, High
21 Llama 4 Maverick 17B Instruct Meta 15.6%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Apr 6, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
15.6 78% confidence 78 percent, Medium
22 GPT-4.1 nano OpenAI 8.9%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Apr 14, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
8.9 82% confidence 82 percent, High
23 Gemma 3 27B IT Google 4.9%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Mar 15, 2025 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
4.9 74% confidence 74 percent, Medium
24 GPT-4o mini OpenAI 3.6%Aider polyglotPublished source fact [variant] Aider polyglot; 225 cases; 2 attemptsPublished Dec 21, 2024 Retrieved Oct 9, 2026 · Apache-2.0
Open source ↗
3.6 100% confidence 100 percent, Full

Results are as published by the source behind each value (hover or tap the number). Benchmark scores are shown individually for every source/variant (a model may have multiple rows), and vary by version, harness and date; the normalized column uses the method’s fixed 0–100 scales and feeds the coding pillar of the SI Score.