Codesota · Models2,268 models indexed · 896 match filter
Editorial · Models

Models with recorded evidence.

Start with a research area, drill into a vendor, or page through the full index. Vendor aliases and legacy area IDs are grouped here; original model IDs and model links stay unchanged. Only models with at least one benchmark score appear — a model without a recorded score can’t be ranked.

Vendor:Areas overviewSpeakLeash · 263Alibaba · 104Google · 102OpenAI · 86Meta · 68Microsoft · 49Anthropic · 44DeepSeek · 34Mistral · 30mistralai · 19CYFRAGOVPL · 14NVIDIA · 14Zhipu AI · 13internlm · 10xAI · 10ByteDance · 9Baidu · 8ibm-granite · 8PLLuM · 8allenai · 7Amazon · 7MiniMax · 7Mistral AI · 7Remek · 7Shanghai AI Lab · 7utter-project · 7CohereForAI · 6Salesforce · 601-ai · 5Cohere · 5Moonshot AI · 5NousResearch · 5THUML · 5gguf-iq · 4IBM · 4Meituan · 4openchat · 4Stanford · 4THUDM · 4tiiuae · 4UC San Diego · 4VikParuchuri · 4Allen AI · 3BAAI · 3Du et al. · 3ForgeCode · 3Fudan University · 3gguf · 3gguf11bv30 · 3gguf7bv30 · 3IDEA Research · 3Liao et al. · 3Moonshot.AI · 3Nam Tuan Ly / NII · 3OpenDataLab · 3OPI-PG · 3upstage · 3ViCoS Lab Ljubljana · 3Xiaomi · 3Zhao et al. · 3+ 243 smaller vendors (288 models)
§ 01 · Computer Vision models

896 models in Computer Vision · page 9 of 18.

#ModelVendorParametersArchitectureBenchmarksResults
401Gemini 2.0 FlashGoogle—Multimodal LLM22
402GLIPv2-H (fine-tuned)———22
403gpt-4o-2024UnknownUnknownUnknown12
404GridFormerAnonymous (arXiv 2023)UnknownGrid vertex and edge prediction via Transformer; handles unconstrained table structures12
405HEADoC-Base—27.7MTransformer22
406HEADoC-Large—90.58MTransformer22
407HTR-JANDUnknown1.5MCNN (FullGatedConv2d + SE blocks) + Combined Attention + Knowledge Distillation12
408HunyuanOCR (1B)Unknown——22
409I2L-STRIPSUnknownUnknownUnknown22
410IASTAcademic—Reading-Order Estimation + Dynamic Sampling12
411Infinity-Parser 7BUnknown7BVision-Language Model12
412InternViT-6B (InternVL)OpenGVLab6BInternViT vision encoder (InternVL family)22
413JSTRFujitakeUnknownDTrOCR + judgment module for image-text matching to reduce misrecognition22
414KOSMOS-2.5Microsoft——12
415LBDMUnknownUnknownUnknown12
416Leaky LP CellUnknownUnknownUnknown12
417LeJEPA ViT-L (304M)———22
418LGPMAUnknownUnknownUnknown12
419LRANet++Academic—Low-Rank Approximation Network12
420LSGSpotterAcademic—Arbitrary Reading Order, Local Semantics Guidance12
421LSTM-reg (single model)UnknownUnknownUnknown22
422MAGNETUnknownUnknownUnknown22
423Marker 1.10.0VikParuchuri—PDF Parser12
424MaskTextSpotter v2UnknownUnknownUnknown12
425MBDUnknownUnknownUnknown12
426MetaWriterUnknownUnknownMeta-learned prompt tuning on HTR backbone (CVPR 2025)12
427MinerU2.5———22
428minicpm-v-4.5-8bUnknownUnknownUnknown12
429mistral-ocr-2512UnknownUnknownUnknown22
430MonkeyOCR-3BMonkeyOCR——12
431MPAD-pathUnknownUnknownUnknown22
432Multi-Task Learning ModelUnknownUnknownUnknown12
433NCP+BTA———12
434NRTR+TPS++UnknownUnknownUnknown22
435olmOCR v0.3.0Allen AI—OCR Pipeline12
436OmniParserAlibaba—Unified framework: text spotting, KIE, table recognition12
437OrigamiNet-18UnknownUnknownUnknown12
438OrigamiNet-24UnknownUnknownUnknown12
439PASTAUnknownUnknownUnknown12
440PyLaia (all transcriptions + agreement-based split)UnknownUnknownUnknown12
441PyLaia (human transcriptions + agreement-based split)UnknownUnknownUnknown12
442PyLaia (human transcriptions + random split)UnknownUnknownUnknown12
443PyLaia (rover consensus + agreement-based split)UnknownUnknownUnknown12
444Qwen2.5-VL 32BAlibaba—Vision-Language Model22
445Qwen3-VL-4BAlibaba Qwen4BVision-Language Model (4B params)22
446ReasTAP-LargeUnknownUnknownUnknown12
447sail-vl2-8bUnknownUnknownUnknown12
448Salience-aware TAPASUnknownUnknownUnknown12
449SANA———12
450SciNCLUnknownUnknownUnknown22