Codesota · Models2,268 models indexed · 896 match filter
Editorial · Models
Models with recorded evidence.
Start with a research area, drill into a vendor, or page through the full index. Vendor aliases and legacy area IDs are grouped here; original model IDs and model links stay unchanged. Only models with at least one benchmark score appear — a model without a recorded score can’t be ranked.
Vendor:Areas overviewSpeakLeash · 263Alibaba · 104Google · 102OpenAI · 86Meta · 68Microsoft · 49Anthropic · 44DeepSeek · 34Mistral · 30mistralai · 19CYFRAGOVPL · 14NVIDIA · 14Zhipu AI · 13internlm · 10xAI · 10ByteDance · 9Baidu · 8ibm-granite · 8PLLuM · 8allenai · 7Amazon · 7MiniMax · 7Mistral AI · 7Remek · 7Shanghai AI Lab · 7utter-project · 7CohereForAI · 6Salesforce · 601-ai · 5Cohere · 5Moonshot AI · 5NousResearch · 5THUML · 5gguf-iq · 4IBM · 4Meituan · 4openchat · 4Stanford · 4THUDM · 4tiiuae · 4UC San Diego · 4VikParuchuri · 4Allen AI · 3BAAI · 3Du et al. · 3ForgeCode · 3Fudan University · 3gguf · 3gguf11bv30 · 3gguf7bv30 · 3IDEA Research · 3Liao et al. · 3Moonshot.AI · 3Nam Tuan Ly / NII · 3OpenDataLab · 3OPI-PG · 3upstage · 3ViCoS Lab Ljubljana · 3Xiaomi · 3Zhao et al. · 3+ 243 smaller vendors (288 models)
§ 01 · Computer Vision models
896 models in Computer Vision · page 15 of 18.
| # | Model | Vendor | Parameters | Architecture | Benchmarks | Results |
|---|---|---|---|---|---|---|
| 701 | Mask R-CNN (ResNeXt-101-FPN) | — | — | — | 1 | 1 |
| 702 | maxvit_base_tf_512.in1k | — | MaxViT base, 512 input, timm | 1 | 1 | |
| 703 | MetaSelf-Learning | Unknown | Unknown | Unknown | 1 | 1 |
| 704 | MinerU2-pipeline | OpenDataLab | — | — | 1 | 1 |
| 705 | MinerU2-VLM | OpenDataLab | — | — | 1 | 1 |
| 706 | Mistral OCR 2 | Mistral | — | Vision-Language Model | 1 | 1 |
| 707 | MLDG | Unknown | Unknown | Unknown | 1 | 1 |
| 708 | molmo-7b | Unknown | Unknown | Unknown | 1 | 1 |
| 709 | MonkeyOCR-pro-1.2B | — | — | — | 1 | 1 |
| 710 | MonkeyOCR-pro-1.2B | MonkeyOCR | — | — | 1 | 1 |
| 711 | MORAN | Unknown | Unknown | Unknown | 1 | 1 |
| 712 | Mr. DETR | — | — | — | 1 | 1 |
| 713 | Multimodal (MobileNetV2) | Unknown | Unknown | Unknown | 1 | 1 |
| 714 | Multimodal (ResNet50) | Unknown | Unknown | Unknown | 1 | 1 |
| 715 | Multimodal Side-Tuning (MobileNetV2) | Unknown | Unknown | Unknown | 1 | 1 |
| 716 | Multimodal Side-Tuning (ResNet50) | Unknown | Unknown | Unknown | 1 | 1 |
| 717 | Nanonets OCR2 3B | Nanonets | — | Vision-Language OCR Model | 1 | 1 |
| 718 | Nanonets-OCR-s | Nanonets | — | — | 1 | 1 |
| 719 | NCBI_BERT(large) (P) | Unknown | Unknown | Unknown | 1 | 1 |
| 720 | NCGM | Unknown | Unknown | Unknown | 1 | 1 |
| 721 | NEC-UIUC | NEC / UIUC | — | — | 1 | 1 |
| 722 | Nemotron Nano V2 VL | NVIDIA | — | Vision-Language Model | 1 | 1 |
| 723 | nextvit_large.bd_ssld_6m_in1k_384 | ByteDance | — | Next-ViT Large, SSLD 6M, IN1K @ 384 | 1 | 1 |
| 724 | NJU-ImagineLab | Nanjing University | Unknown | Scene text detector | 1 | 1 |
| 725 | NormTab (Targeted) + SQL | Unknown | Unknown | Unknown | 1 | 1 |
| 726 | OCRFlux-3B | ChatDoc | — | — | 1 | 1 |
| 727 | OCRVerse 4B | Unknown | 4B | Vision-Language OCR Model | 1 | 1 |
| 728 | olmOCR-2-7B-1025 (7B) | — | — | — | 1 | 1 |
| 729 | OneFormer (Swin-L) | — | — | — | 1 | 1 |
| 730 | Oracle-BERT | Unknown | — | oracle-extractive | 1 | 1 |
| 731 | Oracle-BERT (HowSumm-Method) | Unknown | — | — | 1 | 1 |
| 732 | Oracle-BOW | Unknown | — | oracle-extractive | 1 | 1 |
| 733 | Oracle-BOW (HowSumm-Method) | Unknown | — | — | 1 | 1 |
| 734 | Oracle-HierSumm | Unknown | — | oracle-extractive | 1 | 1 |
| 735 | OTSNet | Anonymous / arxiv preprint | Unknown | Observation-Thinking-Spelling unified network | 1 | 1 |
| 736 | ovis2.5-8b | Unknown | Unknown | Unknown | 1 | 1 |
| 737 | PAC | Yan et al. | — | — | 1 | 1 |
| 738 | PaddleOCR | Baidu | — | Deep Learning OCR | 1 | 1 |
| 739 | PaddleOCR-VL 0.9B | Baidu | 0.9B | Vision-Language Model | 1 | 1 |
| 740 | PaddleOCR-VL-1.5 | Baidu PaddlePaddle | 0.9B | Multi-Task VLM (0.9B params) | 1 | 1 |
| 741 | PaddleOCR-VL-1.5 | Baidu | — | — | 1 | 1 |
| 742 | PANet (Joint) | ICCV 2019 | — | — | 1 | 1 |
| 743 | PesRec | Xingwen Cao et al. (LIESMARS, Wuhan University) | — | Multi-task CNN: spatial layout estimator + 3D object detector + mesh generator | 1 | 1 |
| 744 | PGNet-A | Unknown | Unknown | Unknown | 1 | 1 |
| 745 | PGNet-E | Unknown | Unknown | Unknown | 1 | 1 |
| 746 | phi-4-multimodal | Unknown | Unknown | Unknown | 1 | 1 |
| 747 | pil_maskrcnn | ICT, Chinese Academy of Sciences | Unknown | Mask R-CNN based scene text detector | 1 | 1 |
| 748 | pixtral-12b | Unknown | Unknown | Unknown | 1 | 1 |
| 749 | PLBART | UCLA / Columbia University | 140M | Transformer encoder-decoder | 1 | 1 |
| 750 | pMF-H + FD-loss | N/A | — | — | 1 | 1 |