Back to Topics Directory
Topic Hub

#asr (30 Repositories)

Ranked open-source repositories tagged with #asr, scored by pull request acceptance likelihood and maintainer engagement velocity.

Topic Avg Merge Rate

53.5%

Avg Review Latency

53.5h

Filter by language

30 repositories tagged #asr

S TierRust 253

QuintinShaw/openasr

Local-first speech-to-text: no cloud, no telemetry, fail-closed by design. One CLI, seven model families, signed model catalog, OpenAI-compatible local API.

97.0%
Merge Rate
2d
First Review
100%
1st-Timers
2
Maintainers
S TierPython 19.9k

modelscope/FunASR

Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.

96.7%
Merge Rate
24h
First Review
88%
1st-Timers
4
Maintainers
S TierKotlin 142

soniqo/speech-android

On-device speech SDK for Android — ASR, TTS, VAD, and noise cancellation powered by ONNX Runtime with Qualcomm NNAPI acceleration

96.5%
Merge Rate
4d
First Review
100%
1st-Timers
2
Maintainers
S TierPython 670

Picovoice/cheetah

On-device streaming speech-to-text engine powered by deep learning

95.3%
Merge Rate
18h
First Review
100%
1st-Timers
5
Maintainers
B TierRust 68

drakulavich/kesha-voice-kit

Give your tools a voice — speech to text and back, 25 languages, up to ~19× faster than Whisper. On your machine.

95.6%
Merge Rate
1d
First Review
100%
1st-Timers
0
Maintainers
B TierSwift 106

n0an/VivaDicta

iOS & watchOS speech-to-text app with AI voice keyboard, on-device RAG, and chat with your notes - powered by Apple Foundation Models, WhisperKit, NVIDIA Parakeet, and 20+ AI providers

97.3%
Merge Rate
5d
First Review
100%
1st-Timers
1
Maintainers
A TierDODockerfile 455

jim60105/docker-whisperX

Dockerfile for WhisperX: Automatic Speech Recognition with Word-Level Timestamps and Speaker Diarization (Dockerfile, CI image build and test)

33.3%
Merge Rate
<1h
First Review
0%
1st-Timers
2
Maintainers
A TierSwift 1.1k

soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

93.7%
Merge Rate
2d
First Review
67%
1st-Timers
10
Maintainers
A TierSwift 795

hehehai/voxt

🎙️ An intelligent voice productivity assistant that turns speech into clean text, useful actions, and structured knowledge. It helps users capture ideas, communicate naturally, automate repetitive tasks, and stay productive across different apps and workflows.

84.3%
Merge Rate
2d
First Review
75%
1st-Timers
4
Maintainers
A TierRust 3.2k

Open-Less/openless

Hold a key, speak, release — AI-polished text appears at your cursor in any app. Open-source voice input for macOS & Windows. (按住快捷键说话,松开即得润色后的文字)

85.5%
Merge Rate
4d
First Review
68%
1st-Timers
14
Maintainers
B TierRust 381

izwi-ai/izwi

Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.

96.9%
Merge Rate
18h
First Review
0%
1st-Timers
0
Maintainers
A TierRust 1.0k

Kieirra/murmure

Fully local, private and cross platform Speech-to-Text with LLM Post-processing

83.3%
Merge Rate
1d
First Review
100%
1st-Timers
3
Maintainers
B TierPython 946 4 GFIs

sgl-project/sglang-omni

SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.

54.8%
Merge Rate
13h
First Review
40%
1st-Timers
90
Maintainers
B TierPython 18.4k

NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

69.4%
Merge Rate
3d
First Review
57%
1st-Timers
41
Maintainers
B TierC++ 1.8k

handy-computer/transcribe.cpp

ggml speech-to-text inference for 16+ model families

78.6%
Merge Rate
7d
First Review
40%
1st-Timers
23
Maintainers
B TierPython 311

OpenBMB/UltraEval-Audio

Your faithful, impartial partner for audio evaluation — know yourself, know your rivals. 真实评测,知己知彼。A unified benchmark framework for ASR/TTS/Audio Codec/audio LLM evaluation

100.0%
Merge Rate
15h
First Review
0%
1st-Timers
1
Maintainers
B TierPython 335

Quantatirsk/qwen3-asr

All in one Qwen3-ASR Server, compatible with OpenAI API

50.0%
Merge Rate
2d
First Review
0%
1st-Timers
0
Maintainers
B TierPython 361 1 GFIs

istupakov/onnx-asr

A lightweight Python package for Automatic Speech Recognition using ONNX models

71.4%
Merge Rate
27d
First Review
100%
1st-Timers
1
Maintainers
B TierPython 531

TheDeathDragon/LiveTranslate

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoice), translates via LLM API with streaming display. Perfect for VTubers, livestreamers, and watching foreign content. Windows 实时音频翻译,ASR 语音识别后 LLM 流式翻译显示,适合 VTuber、主播和外语视频观看。

75.0%
Merge Rate
<1h
First Review
0%
1st-Timers
1
Maintainers
B TierC++ 1.6k

mkiol/dsnote

Speech Note Linux app. Note taking, reading and translating with offline Speech to Text, Text to Speech and Machine translation.

50.0%
Merge Rate
3d
First Review
0%
1st-Timers
1
Maintainers
D TierC 9.2k

QwenAudio/SenseVoice

Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 3.0k

CheshireCC/faster-whisper-GUI

faster_whisper GUI with PySide6

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 498

AudarAI/Audar-ASR-V1

Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierTypeScript 501

PiSugar/whisplay-ai-chatbot

Pocket-sized AI chatbot built using a RPI Zero 2w / 5

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierTypeScript 1.5k

amicalhq/amical

🎙️ AI Dictation App - Open Source and Local-first ⚡ Type 3x faster, no keyboard needed. 🆓 Powered by open source models, works offline, fast and accurate.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 483

zenstory-ai/video-recap-skills

Clip any video into a narration recap with claude code skill|用 claude code skill 把任何视频剪辑成中文解说视频,支持剪映导出

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierJUJupyter Notebook 15.1k

alphacep/vosk-api

Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 483

Picovoice/leopard

On-device speech-to-text engine powered by deep learning

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierTypeScript 117

lihaiya/freeipcc

Call Center,Contact Center,AI,呼叫中心,客服系统,工单系统,智能外呼,大模型呼叫中心,智能呼叫中心,FreeSWITCH

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 348

SergeyShk/Speech-to-Text-Russian

Проект для распознавания речи на русском языке на основе pykaldi.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
Best Asr Open Source Repositories & C-Rank™ | GetMerged