Results for “speech-language-model”

61 skills
qhjqhj00
Bss Eval
Evaluates speech language models on beyond-semantic speech attributes such as dialect comprehension, multi-turn context memory, emotion perception, age-aware response generation, and non-verbal cue handling, reporting accuracy and judge-based scores.
3
orchestra-research
Whisper
Transcribe and translate speech across 99 languages using OpenAI's Whisper model, with support for multiple model sizes, batch processing, and subtitle generation.
10.4k · bundle
q2805187159
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
3 · bundle
tianhao909
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
1 · bundle
qcmuu
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
jackychenlu
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
More results
bog5d
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
aniruddhaadak80
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
comeonoliver
Sag
Generates speech from text using ElevenLabs TTS with local playback, supporting voice selection, pronunciation rules, and audio tags.
61
jiachen-t-wang
Scaling Data Constrained Language Models Arxiv 2305 16264v3
Scaling Data-Constrained Language Models
6
comeonoliver
Speech
Generates spoken audio clips from text for narration, voiceovers, IVR prompts, and accessibility reads, with support for single clips and batch processing.
61
diegojcn
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
promisingcoder
Sag
ElevenLabs text-to-speech with mac-style say UX.
0
bouclem
LLM
Large Language Model development, training, fine-tuning, and deployment best practices.
7
jiachen-t-wang
Scaling Laws For Neural Language Models Arxiv 2001 08361v1
Scaling Laws for Neural Language Models
6
desesbraker
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
2
jiachen-t-wang
Dolphins Multimodal Language Model For Driving Arxiv 2312 00
Dolphins: Multimodal Language Model for Driving
6
infometa
Sag
ElevenLabs text-to-speech with mac-style say UX.
228
qhjqhj00
Caa Eval
Benchmarks large audio-language models against adversarial audio attacks using the CAA dataset, computing WER, ROUGE-L, cosine similarity, and coherence scores to assess robustness in conversational settings.
3
jiachen-t-wang
Training Compute Optimal Large Language Models Arxiv 2203 15
Training Compute-Optimal Large Language Models
6
mit-network
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
2
lucaspmarie-a11y
Fal Audio
Converts text to speech and speech to text using fal.ai audio models.
5
inskillflow
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
huggingface
Train Sentence Transformers
Train or fine-tune sentence-transformers models for retrieval, similarity, clustering, classification, and reranking, with support for bi-encoders, cross-encoders, and sparse encoders.
10.8k · bundle
solizardking
Sag
ElevenLabs text-to-speech with mac-style say UX.
0
welitonevoc
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
ichichuang
Whisper
OpenAI's general-purpose speech recognition model. Supports 99 languages, transcription, translation to English, and language identification. Six model sizes from tiny (39M params) to large (1550M params). Use for speech-to-text, podcast transcription, or multilingual audio processing. Best for robust, multilingual ASR.
0 · bundle
om-scogo
Sag
ElevenLabs text-to-speech with mac-style say UX.
0 · bundle
rootcastleco
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
6
doriangallo
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
1
jiachen-t-wang
Scaling Instruction Finetuned Language Models Arxiv 2210 114
Scaling Instruction-Finetuned Language Models
6
iamanacarolinarezende
Fal Audio
Text-to-speech and speech-to-text using fal.ai audio models
0
jiachen-t-wang
Flamingo A Visual Language Model For Few Shot Learning Arxiv
Flamingo: A Visual Language Model for Few-Shot Learning
6
curiositech
Helm Liang 2022
Holistic evaluation framework for language models measuring accuracy, calibration, robustness, and fairness
10 · bundle
lucian55
Shaseng Skill
沙僧(喜剧虚构)认知与表达框架(压缩蒸馏):挑担沉默、和稀泥、团队粘合… 触发:西游记动画 等。全年龄
9 · bundle
jiachen-t-wang
Cogvlm Visual Expert For Pretrained Language Models Arxiv 23
CogVLM: Visual Expert for Pretrained Language Models
6