Results for “speech-language-model”
61 skillsBss Eval
Evaluates speech language models on beyond-semantic speech attributes such as dialect comprehension, multi-turn context memory, emotion perception, age-aware response generation, and non-verbal cue handling, reporting accuracy and judge-based scores.
3
Whisper
Transcribe and translate speech across 99 languages using OpenAI's Whisper model, with support for multiple model sizes, batch processing, and subtitle generation.
10.4k · bundle
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
3 · bundle
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
1 · bundle
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
More results
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
Sag
Generates speech from text using ElevenLabs TTS with local playback, supporting voice selection, pronunciation rules, and audio tags.
61
Scaling Data Constrained Language Models Arxiv 2305 16264v3
Scaling Data-Constrained Language Models
6
Speech
Generates spoken audio clips from text for narration, voiceovers, IVR prompts, and accessibility reads, with support for single clips and batch processing.
61
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
Sag
ElevenLabs text-to-speech with mac-style say UX.
0
LLM
Large Language Model development, training, fine-tuning, and deployment best practices.
7
Scaling Laws For Neural Language Models Arxiv 2001 08361v1
Scaling Laws for Neural Language Models
6
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
2
Dolphins Multimodal Language Model For Driving Arxiv 2312 00
Dolphins: Multimodal Language Model for Driving
6
Sag
ElevenLabs text-to-speech with mac-style say UX.
228
Caa Eval
Benchmarks large audio-language models against adversarial audio attacks using the CAA dataset, computing WER, ROUGE-L, cosine similarity, and coherence scores to assess robustness in conversational settings.
3
Training Compute Optimal Large Language Models Arxiv 2203 15
Training Compute-Optimal Large Language Models
6
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
2
Fal Audio
Converts text to speech and speech to text using fal.ai audio models.
5
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
Train Sentence Transformers
Train or fine-tune sentence-transformers models for retrieval, similarity, clustering, classification, and reranking, with support for bi-encoders, cross-encoders, and sparse encoders.
10.8k · bundle
Sag
ElevenLabs text-to-speech with mac-style say UX.
0
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
Sag
ElevenLabs text-to-speech with mac-style say UX.
0 · bundle
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
6
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
Scaling Instruction Finetuned Language Models Arxiv 2210 114
Scaling Instruction-Finetuned Language Models
6
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
0
Flamingo A Visual Language Model For Few Shot Learning Arxiv
Flamingo: A Visual Language Model for Few-Shot Learning
6
Helm Liang 2022
Holistic evaluation framework for language models measuring accuracy, calibration, robustness, and fairness
10 · bundle
Shaseng Skill
沙僧(喜剧虚构)认知与表达框架(压缩蒸馏):挑担沉默、和稀泥、团队粘合… 触发:西游记动画 等。全年龄
9 · bundle
Cogvlm Visual Expert For Pretrained Language Models Arxiv 23
CogVLM: Visual Expert for Pretrained Language Models
6