Un micro de studio sur pied, un anneau cyan au bas de la grille.

Transcription audio locale : réunion, dictée ou fichier, quel outil choisir

Trois logiciels libres transcrivent la voix sans l'envoyer à un service en ligne, et chacun vise un usage différent. Meetily enregistre une réunion par le micro et le son du système, la transcrit en direct, puis en rédige le compte rendu avec un modèle de langage, local ou distant. Murmure écrit la dictée d'une seule personne dans la fenêtre active, sur le seul processeur. Scriberr est un serveur qui transcrit des fichiers déjà enregistrés et sépare les locuteurs, mais il n'a publié aucune version depuis décembre 2025 et son mainteneur envisage de le réécrire. Les trois savent faire tourner Parakeet, de NVIDIA ; Meetily et Scriberr proposent aussi Whisper.

Réunion, dictée ou fichier enregistré : trois usages

Meetily est taillé pour la réunion. Aucun robot ne rejoint l'appel : l'application capte le micro et le son du système, quel que soit le logiciel de visioconférence, et range réunions et transcriptions dans une base SQLite locale. Son édition libre ne distingue pas les intervenants : chaque segment porte seulement sa source, mic ou system, et la séparation des locuteurs appartient à l'offre PRO, alors que la description du dépôt GitHub l'annonce. Un fichier audio peut aussi être importé et retranscrit, une fonction encore marquée bêta.

Murmure sert à dicter. Un raccourci lance l'enregistrement, et le texte s'écrit dans la fenêtre active : traitement de texte, terminal ou champ de saisie d'un assistant IA. Sa FAQ le réserve à une seule voix et écarte la transcription de réunions. Pour un fichier, il faut activer son API locale, qui reçoit du WAV sur 127.0.0.1:4800 ; depuis la v1.11.3, elle découpe l'audio comme la dictée, et seule la taille de la requête la limite encore. La documentation annonce toujours 5 minutes au plus par enregistrement, une limite que le journal des versions dit levée depuis la v1.10.1 par un découpage sur les silences.

Scriberr part d'enregistrements existants. Ce serveur web écrit en Go s'utilise depuis un navigateur et accepte des fichiers audio ou vidéo, une URL YouTube, un projet Audacity multipiste ou un enregistrement fait dans l'interface. Il rend un texte horodaté au mot, exporté en JSON, SRT ou TXT, et sépare les locuteurs avec PyAnnote, réglable jusqu'à 20 voix, ou Sortformer, de NVIDIA, optimisé pour quatre. Une API REST appelle un webhook en fin de transcription, et un client en ligne de commande envoie au serveur chaque nouveau fichier d'un dossier surveillé. Son auteur l'a écrit pour ne plus payer la transcription en ligne de son enregistreur Plaud Note, 100 dollars par an pour 20 heures par mois.

Whisper ou Parakeet : les modèles de transcription

Whisper tourne dans Meetily et dans Scriberr. Meetily passe par whisper.cpp, avec des modèles de tiny à large-v3 téléchargés depuis Hugging Face, large-v3-turbo par défaut. Scriberr emploie WhisperX, lui aussi de tiny à large-v3, qui couvre plus de 90 langues et sait traduire vers l'anglais.

Parakeet TDT 0.6B v3, de NVIDIA, est le seul modèle de Murmure, qui le fait tourner sur le processeur. D'après le site du projet, il égale whisper-large en précision avec 0,6 milliard de paramètres, contre 1,5 milliard. Meetily le propose aussi, au format ONNX quantifié en int8.

Le même modèle ne couvre pas les mêmes langues d'un outil à l'autre. Murmure s'en sert pour 25 langues européennes, sans réglage pour imposer la langue : avec un micro médiocre ou du bruit, la transcription bascule en anglais, le problème le plus signalé selon sa documentation. Le français, l'anglais, l'allemand et le suédois y sont les mieux reconnus. Scriberr, dans le code de son adaptateur, déclare Parakeet v3 pour l'anglais seulement : pour du français, il reste WhisperX ou Canary 1B v2, un autre modèle de NVIDIA.

Ce que chaque outil demande pour tourner

Relevé dans les dépôts et les documentations le 7 octobre 2026.

OutilLicenceForme et plateformesModèles de transcriptionMatériel documentéDernière version
MeetilyMIT, édition communautaireappli de bureau, base SQLite ; installeurs Windows x64 et macOS Apple Silicon, à compiler ailleursWhisper (whisper.cpp), Parakeet TDT 0.6B v3processeur AVX2 sous Windows ; GPU par Vulkan ou Metal, CUDA en compilant ; mémoire non documentée0.4.1, 12 sept. 2026
MurmureAGPL-3.0 ou ultérieureappli de bureau, sans base ; Windows 10+, macOS Apple Silicon et Intel, Linux en .deb, .rpm, pacman ou AppImageParakeet TDT 0.6B v3processeur seul, 2 Go de RAM libres, 1 Go de disque1.11.3, 31 août 2026
ScriberrMIT pour le code, CC-BY-4.0 pour les modèles NVIDIAserveur Go, SQLite, environnements Python ; Docker ou Homebrew ; un seul compteWhisperX, Canary 1B v2, Parakeet v3 (anglais) ; diarisation par PyAnnote ou Sortformerprocesseur ou GPU NVIDIA ; de 2 Go (WhisperX) à 8 Go et plus (Canary) selon le code1.2.0, 17 déc. 2025

Murmure chiffre ses besoins sur son site : 2 Go de RAM libres et 1 Go de disque, sans carte graphique. Ses installeurs de la v1.11.3 pèsent de 600 à 865 Mo. Son Prompt Mode, qui confie la dictée à un LLM pour la traduire ou la reformater, en demande davantage : sans GPU, il répond très lentement, et la documentation conseille 4 à 8 Go de mémoire vidéo selon le modèle. Sous Linux, le .deb exige la GLIBC 2.38 d'Ubuntu 24.04, et sous Wayland Murmure ne déclare aucun raccourci global : on lie un raccourci du bureau à murmure --transcription, sans push-to-talk.

Meetily ne donne dans son README aucun besoin en mémoire pour la transcription. Ses installeurs couvrent Windows x64, avec un processeur compatible AVX2 et Whisper compilé pour Vulkan, et macOS sur Apple Silicon, avec Metal et Core ML. Sous Linux ou sur un Mac Intel, il faut compiler depuis les sources avec Rust, Node.js et pnpm, et CUDA ne s'obtient qu'en compilant aussi. Le résumé local passe par llama.cpp, intégré à l'application, et quatre modèles GGUF : selon l'application, Gemma 3 1B tourne avec environ 1 Go de RAM et Gemma 3 4B en demande 3,5.

Scriberr ne chiffre pas la mémoire dans sa documentation, mais son code recommande 2 Go pour WhisperX, 4 Go pour Parakeet et 8 Go ou plus pour Canary, avec un GPU « fortement » conseillé. Seules les cartes NVIDIA accélèrent la transcription : la documentation fournit une image Docker CPU, une image CUDA pour les GTX 10 à RTX 40 et une image à part pour les RTX 50, aucune pour AMD. Sur macOS, Parakeet, Canary, PyAnnote et Sortformer s'installent avec PyTorch en version CPU. Le premier démarrage installe un environnement Python par famille de modèles et télécharge plusieurs gigaoctets : 2,3 Go pour Parakeet et 5,9 Go pour Canary dans le journal d'exemple de la documentation. Ses cookies étant marqués Secure en production, Scriberr servi en HTTP simple ne lit plus l'audio, sauf à poser SECURE_COOKIES=false.

Ce qui quitte la machine

Par défaut, Meetily, Murmure et Scriberr gardent l'audio sur la machine. Les écarts tiennent aux services qu'on y branche.

Meetily envoie le texte de la transcription, jamais l'audio, au fournisseur du résumé quand on en choisit un distant : Claude, Groq, OpenRouter, OpenAI ou un point d'accès compatible OpenAI. Pour rester en local, le résumé passe par llama.cpp intégré ou par Ollama. L'application télécharge ses modèles depuis Hugging Face, et Parakeet depuis meetily.towardsgeneralintelligence.com. Sa télémétrie PostHog est désactivée par défaut depuis la v0.4.0 ; activée, elle envoie des mesures d'usage, sans le contenu des réunions.

Murmure interroge GitHub à chaque lancement pour chercher une mise à jour, et l'application n'a aucun réglage pour l'en empêcher ; selon sa politique de confidentialité, la requête ne contient ni audio ni texte. Brancher le Prompt Mode sur un serveur distant y envoie les transcriptions, ce que Murmure signale à la configuration ; le même mode accepte un Ollama local. L'historique reste en mémoire et s'efface à la fermeture, sauf si l'on active l'option qui garde les cinq dernières transcriptions sur le disque.

Scriberr ne fait rien sortir par défaut. Deux options envoient le contenu ailleurs : la transcription par l'API d'OpenAI, inactive tant que OPENAI_API_KEY reste vide, et les résumés ou questions confiés à une API distante compatible OpenAI plutôt qu'à Ollama. La diarisation par PyAnnote exige un compte Hugging Face, l'acceptation des conditions de ses modèles et un jeton, qui sert au téléchargement : selon la documentation, aucun audio n'est envoyé.

Où en sont les projets

Meetily en est à la v0.4.1 du 12 septembre 2026, faite surtout de correctifs, quatrième version de l'année. Le 7 octobre 2026, son dépôt comptait 202 tickets et 158 pull requests ouverts.

Murmure, dont le dépôt date d'octobre 2025, a publié une version mineure tous les un à deux mois en 2026, jusqu'à la v1.11.3 du 31 août. Un développeur signe 554 des 603 commits de la branche principale.

Scriberr n'a rien publié depuis sa v1.2.0 du 17 décembre 2025. Les commits suivants, jusqu'en mars 2026, ajoutent notamment Voxtral Mini, de Mistral, absent de toute version. Son mainteneur, auteur de 636 des 828 commits, a suspendu le développement en mars 2026, puis annoncé sa reprise le 20 septembre dans une discussion du dépôt sur l'avenir du projet. Il y penche pour reconstruire le moteur sur onnx-asr ou audio.cpp plutôt que de traiter les tickets et les 21 pull requests ouvertes, au prix « probablement » de changements cassants. Le passage de la v1.1 à la v1.2 en imposait déjà un : supprimer l'ancien environnement Python et séparer les volumes.

Licences et offres payantes

Meetily se décline en deux produits. L'édition communautaire est sous MIT, et son README promet qu'elle restera « free & open source forever ». L'offre PRO, à 10 dollars par utilisateur et par mois facturés à l'année, relève d'une licence commerciale et d'une autre base de code. Sa page de vente y place la séparation des locuteurs, en direct comme sur un fichier importé, et le README y ajoute les modèles de compte rendu personnalisés, les exports PDF, DOCX et Markdown, la détection automatique des réunions et un déploiement auto-hébergé pour les équipes de 2 à 100 personnes. Au-delà, l'éditeur renvoie vers une offre Enterprise sur devis. Le README marque encore l'identification des locuteurs « Coming Soon », quand la page de l'offre la présente comme disponible.

Murmure est sous AGPL-3.0 ou ultérieure : une version dérivée doit rester open source. Il n'a pas d'offre payante (« No business model », dit son site) et reçoit des dons via Tipeee.

Scriberr est sous MIT, mais cette licence ne couvre que son code : Parakeet, Canary et Sortformer sont sous CC-BY-4.0, et PyAnnote soumet ses modèles à des conditions à accepter sur Hugging Face. Le projet n'a ni offre payante ni service cloud ; il reçoit des dons sur Ko-fi et affiche Recall.ai comme sponsor.