Codesota · Models2,268 models indexed · 104 match filter
Editorial · Models

Models with recorded evidence.

Start with a research area, drill into a vendor, or page through the full index. Vendor aliases and legacy area IDs are grouped here; original model IDs and model links stay unchanged. Only models with at least one benchmark score appear — a model without a recorded score can’t be ranked.

Vendor:Areas overviewSpeakLeash · 263Alibaba · 104Google · 102OpenAI · 86Meta · 68Microsoft · 49Anthropic · 44DeepSeek · 34Mistral · 30mistralai · 19CYFRAGOVPL · 14NVIDIA · 14Zhipu AI · 13internlm · 10xAI · 10ByteDance · 9Baidu · 8ibm-granite · 8PLLuM · 8allenai · 7Amazon · 7MiniMax · 7Mistral AI · 7Remek · 7Shanghai AI Lab · 7utter-project · 7CohereForAI · 6Salesforce · 601-ai · 5Cohere · 5Moonshot AI · 5NousResearch · 5THUML · 5gguf-iq · 4IBM · 4Meituan · 4openchat · 4Stanford · 4THUDM · 4tiiuae · 4UC San Diego · 4VikParuchuri · 4Allen AI · 3BAAI · 3Du et al. · 3ForgeCode · 3Fudan University · 3gguf · 3gguf11bv30 · 3gguf7bv30 · 3IDEA Research · 3Liao et al. · 3Moonshot.AI · 3Nam Tuan Ly / NII · 3OpenDataLab · 3OPI-PG · 3upstage · 3ViCoS Lab Ljubljana · 3Xiaomi · 3Zhao et al. · 3+ 243 smaller vendors (288 models)
§ 01 · Speech models

104 models in Speech · page 1 of 3.

#ModelVendorParametersArchitectureBenchmarksResults
001Whisper Large v2OpenAI1.5BTransformer encoder-decoder1014
002wav2vec 2.0 Large (960h)Meta317MCNN feature encoder + Transformer912
003Asr-conformer-loquacious———89
004Asr-wav2vec2-librispeech———89
005Data2vec-audio-base-960h———89
006Data2vec-audio-large-960h———89
007Distil-large-v2———89
008Distil-large-v3———89
009Distil-medium.en———89
010Distil-small.en———89
011Granite Speech 3.3 2BIBM2BTransformer89
012Granite Speech 4.1 2BIBM2BTransformer (speech+text)89
013Hubert-large-ls960-ft———89
014Hubert-xlarge-ls960-ft———89
015Lite-whisper-large-v3-fast———89
016Lite-whisper-large-v3-turbo-acc———89
017Llama 3 (405B, Instruct)Meta——99
018Mms-1b-all———89
019Mms-1b-fl102———89
020Moonshine-base———89
021Moonshine-streaming-tiny———89
022Moonshine-tiny———89
023Parakeet-ctc-0.6b———89
024Parakeet-rnnt-0.6b———89
025Parakeet-tdt_ctc-110m———89
026Phi-4 Multimodal InstructMicrosoft6BPhi-4 multimodal89
027Qwen3.5-Omni-Plus———99
028Stt_en_conformer_ctc_large———89
029Stt_en_conformer_ctc_small———89
030Stt_en_fastconformer_ctc_large———89
031Stt_en_fastconformer_transducer_large———89
032SYMPHONY-ASR———89
033VibeVoice-ASR-HF———89
034Voxtral-Mini-4B-Realtime-2602Mistral AI4BTransformer ASR89
035Wav2vec2-base-960h———89
036Wav2vec2-conformer-rel-pos-large-960h-ft———89
037Wav2vec2-conformer-rope-large-960h-ft———89
038Wav2vec2-large-960h-lv60-self———89
039Wav2vec2-large-robust-ft-libri-960h———89
040Whisper-base.en———89
041Whisper Large———89
042Whisper Large v3OpenAI1.5BTransformer encoder-decoder69
043Whisper Large v3 TurboOpenAI809MTransformer encoder-decoder (pruned decoder)89
044Whisper-medium.en———89
045Whisper-small.en———89
046Whisper-tiny.en———89
047Niagara-38m-batch.en———88
048Qwen3-ASR-1.7BAlibaba1.7BTransformer (Qwen3 backbone)78
049Audio Flamingo 3———77
050Cohere Transcribe (Mar 2026)Cohere2BTransformer ASR67