Dictée vocale appui-pour-parler pour Linux, dans n'importe quelle application
Tenez une touche, parlez, relâchez : le texte transcrit s'insère dans la fenêtre active. Adossé à Whisper via faster-whisper, entièrement open source et respectueux de la vie privée : rien de ce que vous dites ne quitte jamais votre appareil.
v1.0.1 · en / fr / de / es · 100 % hors ligne · appui-pour-parler
WhispSkrid n'est pas un moteur de reconnaissance vocale — c'est une couche de dictée en ligne de commande construite au-dessus de Whisper, servi par faster-whisper (CTranslate2). Whisper transcrit ; ce projet gère la touche d'appui-pour-parler, la capture audio pendant l'appui, la socket de contrôle qui relie les raccourcis du bureau, et l'insertion du résultat dans l'application qui a le focus.
Léger, persistant
Le modèle Whisper est chargé une seule fois dans un processus persistant, puis
la transcription se fait à la relâche de la touche. Le modèle base
en int8 pèse environ 145 Mo sur disque et culmine à
0,5–0,6 Go de RAM en CPU (environ 0,3 Go de VRAM en GPU) ; du
tiny au large-v3, la gamme va d'environ 75 Mo à
3 Go sur disque. Aucun découpage automatique de la parole : ce qui est enregistré
entre l'appui et la relâche part en une seule passe.
- L'appui-pour-parler est strict : la capture dure exactement le temps où la touche est tenue, sans minuteur ni coupure sur silence.
- Seul garde-fou automatique : une durée maximale de capture, haute et configurable, contre une touche restée bloquée.
- Une fois le modèle présent en local, plus aucune connexion réseau n'est nécessaire.
Des relevés réels par machine ont été effectués pendant la validation sur cinq machines et ne sont pas publiés ici — seuls les ordres de grandeur ci-dessus font foi.
Principales caractéristiques
Appui-pour-parler strict
L'enregistrement dure exactement le temps où vous tenez la touche. Aucune coupure automatique, aucun minuteur, aucune détection de fin de phrase.
Quatre langues
Anglais, français, allemand et espagnol. -l fr force la langue passée à Whisper ; sans argument, Whisper détecte seul.
Deux voies de déclenchement
Un écouteur de touche local en maintien natif, ou des sous-commandes liées aux raccourcis globaux de votre bureau — la voie qui fonctionne partout sous Wayland.
Un seul fichier de configuration
Modèle, touche d'appui, périphérique audio, presse-papiers, thème : tout dans config.yaml, surchargé clé à clé depuis votre dossier personnel.
Whisper ponctue seul
Ponctuation et majuscules viennent du modèle. Le post-traitement se limite au rognage des blancs et à la capitale d'entrée.
100 % hors ligne
Le modèle est chargé depuis un dossier local. Aucune donnée ne quitte votre appareil.
Tout est configurable
Touche d'appui, modèle, périphérique audio, presse-papiers — un seul fichier YAML lisible.
hotkeys:
# Écouteur pynput local (best-effort ; sous Wayland,
# fenêtres XWayland seulement).
pynput_enabled: true
# Maintien = capture ; relâche = transcription.
push_to_talk: ["shift_r"]
theme:
ready_message: "GREEN"
info: "RESET"
warning: "YELLOW"
error: "RED"
Touche et thème
La touche d'appui-pour-parler se surcharge, et l'écouteur local se coupe d'un booléen quand vous préférez piloter par les raccourcis du bureau. Les couleurs de la sortie terminal se règlent message par message.
- Touche d'appui configurable ; Maj droit par défaut.
- Écouteur local activable ou non.
- Couleur personnalisable par type de message.
backend:
name: "faster-whisper"
beam_size: 5
models:
default: "base" # tiny | base | small | medium | large-v3
dir: "" # vide => emplacements standard
device: "auto" # cpu | cuda | auto
compute_type: "auto" # int8 | float16 | auto
capture:
max_seconds: 300
Moteur et modèles
Le modèle par défaut se change à tout moment, par nom court ou par chemin absolu, sans recompilation. device et compute_type restent en auto : int8 sur CPU, float16 sur CUDA.
- Modèle choisi par
config.yamlou par--model. - Dossier de modèles géré ; le cache Hugging Face n'est qu'un repli.
- Garde-fou de durée de capture contre une touche bloquée.
Installez-le
Sur Debian ou Ubuntu, une commande et un modèle ; Fedora, openSUSE et Arch Linux ont leurs propres paquets. Le guide complet couvre aussi l’installation depuis les sources, le choix du modèle et les raccourcis du bureau.
Installer le paquet
Récupérez le .deb sur la page des téléchargements, puis :
sudo apt install ./whispskrid_1.0.1_all.debAu premier passage, le paquet crée un environnement virtuel privé et y installe faster-whisper (accès réseau nécessaire à ce moment-là).
Télécharger un modèle
Récupérez un modèle Whisper et vérifiez qu'il se charge :
whispskrid --download-model base # aussi : tiny, small, medium, large-v3Si aucun modèle n'est présent, l'outil propose le téléchargement au premier lancement.
Dicter
Lancez une session dans la langue voulue, puis tenez la touche d'appui :
whispskrid -l frDepuis les sources (pour développer)
Pour travailler sur le code, exécutez-le depuis un clone git :
git clone https://github.com/RonanDavalan/whispskrid.git
cd whispskrid
python3 -m venv .venv
.venv/bin/pip install -e .
.venv/bin/whispskrid -l fr