265K images with 1.1M questions. Balanced dataset to reduce language biases found in v1.
Accuracy is the reported evaluation metric for VQA v2.0. Codesota tracks published model scores on this metric so readers can compare state-of-the-art results across sources and model families.
Higher is better
Muted rows were not state of the art when published — an earlier or same-year result already scored better.
| Rank | Model | Trust | Score | Year | Links | Fix |
|---|---|---|---|---|---|---|
| 01 | Qwen2-VL 72B | verified | 87.6 | 2026 | Source ↗ | Looks wrong? |
| 02 | InternVL2-76B | verified | 87.2 | 2026 | Source ↗ | Looks wrong? |
| 03 | Gemini 1.5 Pro | verified | 86.5 | 2026 | Source ↗ | Looks wrong? |
| 04 | PaLI-X 55B | verified | 86.1 | 2026 | Source ↗ | Looks wrong? |
| 05 | NVLM-D 1.0 72B | verified | 85.4 | 2026 | Source ↗ | Looks wrong? |
| 06 | NVLM-X 1.0 72B | verified | 85.2 | 2026 | Source ↗ | Looks wrong? |
| 07 | NVLM-H 1.0 72B | verified | 85.2 | 2026 | Source ↗ | Looks wrong? |
| 08 | VILA-1.5 40B | verified | 84.3 | 2026 | Source ↗ | Looks wrong? |
| 09 | LLaVA-NeXT 34B | verified | 83.7 | 2026 | Source ↗ | Looks wrong? |
| 10 | LLaVA-NeXT 13B | verified | 82.8 | 2026 | Source ↗ | Looks wrong? |
| 11 | CogVLM-17B | verified | 82.3 | 2026 | Source ↗ | Looks wrong? |
| 12 | LLaVA-NeXT 7B (Mistral) | verified | 82.2 | 2026 | Source ↗ | Looks wrong? |
| 13 | BLIP-2 | verified | 82.19 | 2026 | Source ↗ | Looks wrong? |
| 14 | LLaVA-NeXT 7B (Vicuna) | verified | 81.8 | 2026 | Source ↗ | Looks wrong? |
| 15 | Pixtral Large | vendor | 80.9 | 2026 | Source ↗ | Looks wrong? |
| 16 | Llama 3-V 405B | verified | 80.2 | 2026 | Source ↗ | Looks wrong? |
| 17 | LLaVA-1.5 13B | verified | 80 | 2026 | Source ↗ | Looks wrong? |
| 18 | LLaVA-1.5 | verified | 80 | 2026 | Source ↗ | Looks wrong? |
| 19 | Llama 3-V 70B | verified | 79.1 | 2026 | Source ↗ | Looks wrong? |
| 20 | Pixtral-12B | vendor | 78.6 | 2026 | Source ↗ | Looks wrong? |
| 21 | GPT-4o | verified | 78.5 | 2026 | Source ↗ | Looks wrong? |
| 22 | Llama 3.2 90B Vision Instruct | vendor | 78.1 | 2026 | Source ↗ | Looks wrong? |
| 23 | GPT-4V | verified | 77.2 | 2026 | Source ↗ | Looks wrong? |