Codesota · Models2,268 models indexed · 896 match filter
Editorial · Models
Models with recorded evidence.
Start with a research area, drill into a vendor, or page through the full index. Vendor aliases and legacy area IDs are grouped here; original model IDs and model links stay unchanged. Only models with at least one benchmark score appear — a model without a recorded score can’t be ranked.
Vendor:Areas overviewSpeakLeash · 263Alibaba · 104Google · 102OpenAI · 86Meta · 68Microsoft · 49Anthropic · 44DeepSeek · 34Mistral · 30mistralai · 19CYFRAGOVPL · 14NVIDIA · 14Zhipu AI · 13internlm · 10xAI · 10ByteDance · 9Baidu · 8ibm-granite · 8PLLuM · 8allenai · 7Amazon · 7MiniMax · 7Mistral AI · 7Remek · 7Shanghai AI Lab · 7utter-project · 7CohereForAI · 6Salesforce · 601-ai · 5Cohere · 5Moonshot AI · 5NousResearch · 5THUML · 5gguf-iq · 4IBM · 4Meituan · 4openchat · 4Stanford · 4THUDM · 4tiiuae · 4UC San Diego · 4VikParuchuri · 4Allen AI · 3BAAI · 3Du et al. · 3ForgeCode · 3Fudan University · 3gguf · 3gguf11bv30 · 3gguf7bv30 · 3IDEA Research · 3Liao et al. · 3Moonshot.AI · 3Nam Tuan Ly / NII · 3OpenDataLab · 3OPI-PG · 3upstage · 3ViCoS Lab Ljubljana · 3Xiaomi · 3Zhao et al. · 3+ 243 smaller vendors (288 models)
§ 01 · Computer Vision models
896 models in Computer Vision · page 5 of 18.
| # | Model | Vendor | Parameters | Architecture | Benchmarks | Results |
|---|---|---|---|---|---|---|
| 201 | SEED | Unknown | Unknown | Unknown | 4 | 4 |
| 202 | T5-11B | Unknown | Unknown | 2 | 4 | |
| 203 | TextPerceptron | Unknown | Unknown | Unknown | 2 | 4 |
| 204 | ViTSTR | Unknown | Unknown | Unknown | 4 | 4 |
| 205 | Yet Another Text Recognizer | Unknown | Unknown | Unknown | 4 | 4 |
| 206 | AIMv2 ViT-3B/14 448px | — | — | — | 3 | 3 |
| 207 | AKHCRNet | Unknown | Unknown | Unknown | 1 | 3 |
| 208 | ALIGN | — | — | — | 3 | 3 |
| 209 | AltCLIP | — | — | — | 3 | 3 |
| 210 | APE-Large | Tsinghua / MEGVII | Unknown | Aligned vision encoder + region-text alignment with EVA-02 ViT-L backbone | 1 | 3 |
| 211 | ASNMF-SRP | Zhong and Gao | — | — | 1 | 3 |
| 212 | ASTER | Unknown | Unknown | Unknown | 3 | 3 |
| 213 | BertSumExt | Unknown | Unknown | Unknown | 1 | 3 |
| 214 | BERTSUM+Transformer | Unknown | Unknown | Unknown | 1 | 3 |
| 215 | BiT-L | — | — | — | 3 | 3 |
| 216 | BPDO | Zheng et al. | Unknown | ResNet-50 + FPN + DCN + Text-Aware Module + Dynamic Optimization Module | 1 | 3 |
| 217 | BRIDO | BRIDO Authors | — | BART-based with democratic contrastive learning for factual consistency | 1 | 3 |
| 218 | CCD-ViT-Base | Unknown | Unknown | Unknown | 3 | 3 |
| 219 | CharNet H-50 (multi-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 220 | CharNet H-50 (single-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 221 | CharNet H-57 (multi-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 222 | CharNet H-57 (single-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 223 | CharNet H-88 (single-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 224 | CharNet R-50 | Unknown | Unknown | Unknown | 1 | 3 |
| 225 | Ch,ng et al. | Unknown | Unknown | Unknown | 1 | 3 |
| 226 | Claude-3 Sonnet | Unknown | Unknown | Unknown | 1 | 3 |
| 227 | CN-CLIP | — | — | — | 3 | 3 |
| 228 | CodeT5+ | Salesforce | Unknown | T5-based encoder-decoder | 3 | 3 |
| 229 | CodeTrans-MT-Base | Unknown | Unknown | Unknown | 3 | 3 |
| 230 | ContourNet [69] | Unknown | Unknown | Unknown | 1 | 3 |
| 231 | ConvNeXt (XL) | — | — | — | 3 | 3 |
| 232 | Cooperative | Unknown | Unknown | Unknown | 1 | 3 |
| 233 | Corner Localization | Unknown | Unknown | Unknown | 1 | 3 |
| 234 | Corner Localization (single-scale) | Unknown | Unknown | Unknown | 1 | 3 |
| 235 | CPN (Complementary Proposal Network) | Longhuang Wu et al. | Unknown | Deformable Morphology Semantic Network + Balanced Region Proposal Network + Interleaved Feature Attention | 1 | 3 |
| 236 | DAT-DET | Wan et al. (Baidu) | Unknown | Interactive attention transformer for multi-granularity text detection | 1 | 3 |
| 237 | DAT-SEG | Wan et al. (Baidu) | Unknown | Interactive attention transformer with segmentation head for multi-granularity text detection | 1 | 3 |
| 238 | Davar-Lab-OCR | Hikvision Research Institute | — | — | 1 | 3 |
| 239 | DBNet++ (ResNet-18) (1024) | Liao et al. | Unknown | ResNet-18 + Differentiable Binarization + Adaptive Scale Fusion | 1 | 3 |
| 240 | DBNet (ResNet-18+DCN) | Liao et al. (USTC) | Unknown | ResNet-18 + Deformable Convolution + Differentiable Binarization | 1 | 3 |
| 241 | DBNet++ (ResNet-50) (1024) | Liao et al. | Unknown | ResNet-50 + Differentiable Binarization + Adaptive Scale Fusion | 1 | 3 |
| 242 | DBNet (ResNet-50+DCN) | Liao et al. (USTC) | Unknown | ResNet-50 + Deformable Convolution + Differentiable Binarization | 1 | 3 |
| 243 | DB-ResNet-50 (1152) | Unknown | Unknown | Unknown | 1 | 3 |
| 244 | DB-ResNet-50 (736) | Unknown | Unknown | Unknown | 1 | 3 |
| 245 | DeepSolo (with pre-training) | ViTAE-Transformer | Unknown | DETR-like Transformer decoder with explicit points | 1 | 3 |
| 246 | DnC-SC | Unknown | Unknown | Unknown | 1 | 3 |
| 247 | dots.ocr 3B | RedNote HILab | 3B | Vision-Language Model | 2 | 3 |
| 248 | DPNet (ResNet-50, 736px) | Fang et al. | Unknown | ResNet-50 + Channel Enhanced Self-Attention Module (CESAM) + Spatial Enhanced Self-Attention Module (SESAM) | 1 | 3 |
| 249 | DPText-DETR (ResNet50) | Unknown | Unknown | Unknown | 1 | 3 |
| 250 | DRRG [72] | Unknown | Unknown | Unknown | 1 | 3 |