Dictée vocale appui-pour-parler pour Linux, dans n'importe quelle application

Tenez une touche, parlez, relâchez : le texte transcrit s'insère dans la fenêtre active. Adossé à Whisper via faster-whisper, entièrement open source et respectueux de la vie privée : rien de ce que vous dites ne quitte jamais votre appareil.

v1.0.1 · en / fr / de / es · 100 % hors ligne · appui-pour-parler

WhispSkrid n'est pas un moteur de reconnaissance vocale — c'est une couche de dictée en ligne de commande construite au-dessus de Whisper, servi par faster-whisper (CTranslate2). Whisper transcrit ; ce projet gère la touche d'appui-pour-parler, la capture audio pendant l'appui, la socket de contrôle qui relie les raccourcis du bureau, et l'insertion du résultat dans l'application qui a le focus.

Léger, persistant

Le modèle Whisper est chargé une seule fois dans un processus persistant, puis la transcription se fait à la relâche de la touche. Le modèle base en int8 pèse environ 145 Mo sur disque et culmine à 0,5–0,6 Go de RAM en CPU (environ 0,3 Go de VRAM en GPU) ; du tiny au large-v3, la gamme va d'environ 75 Mo à 3 Go sur disque. Aucun découpage automatique de la parole : ce qui est enregistré entre l'appui et la relâche part en une seule passe.

  • L'appui-pour-parler est strict : la capture dure exactement le temps où la touche est tenue, sans minuteur ni coupure sur silence.
  • Seul garde-fou automatique : une durée maximale de capture, haute et configurable, contre une touche restée bloquée.
  • Une fois le modèle présent en local, plus aucune connexion réseau n'est nécessaire.

Des relevés réels par machine ont été effectués pendant la validation sur cinq machines et ne sont pas publiés ici — seuls les ordres de grandeur ci-dessus font foi.

Principales caractéristiques

Appui-pour-parler strict

L'enregistrement dure exactement le temps où vous tenez la touche. Aucune coupure automatique, aucun minuteur, aucune détection de fin de phrase.

Quatre langues

Anglais, français, allemand et espagnol. -l fr force la langue passée à Whisper ; sans argument, Whisper détecte seul.

Deux voies de déclenchement

Un écouteur de touche local en maintien natif, ou des sous-commandes liées aux raccourcis globaux de votre bureau — la voie qui fonctionne partout sous Wayland.

Un seul fichier de configuration

Modèle, touche d'appui, périphérique audio, presse-papiers, thème : tout dans config.yaml, surchargé clé à clé depuis votre dossier personnel.

Whisper ponctue seul

Ponctuation et majuscules viennent du modèle. Le post-traitement se limite au rognage des blancs et à la capitale d'entrée.

100 % hors ligne

Le modèle est chargé depuis un dossier local. Aucune donnée ne quitte votre appareil.

Tout est configurable

Touche d'appui, modèle, périphérique audio, presse-papiers — un seul fichier YAML lisible.

config.yaml
hotkeys:
  # Écouteur pynput local (best-effort ; sous Wayland,
  # fenêtres XWayland seulement).
  pynput_enabled: true
  # Maintien = capture ; relâche = transcription.
  push_to_talk: ["shift_r"]

theme:
  ready_message: "GREEN"
  info: "RESET"
  warning: "YELLOW"
  error: "RED"

Touche et thème

La touche d'appui-pour-parler se surcharge, et l'écouteur local se coupe d'un booléen quand vous préférez piloter par les raccourcis du bureau. Les couleurs de la sortie terminal se règlent message par message.

  • Touche d'appui configurable ; Maj droit par défaut.
  • Écouteur local activable ou non.
  • Couleur personnalisable par type de message.
config.yaml
backend:
  name: "faster-whisper"
  beam_size: 5

models:
  default: "base"        # tiny | base | small | medium | large-v3
  dir: ""                # vide => emplacements standard
  device: "auto"         # cpu | cuda | auto
  compute_type: "auto"   # int8 | float16 | auto

capture:
  max_seconds: 300

Moteur et modèles

Le modèle par défaut se change à tout moment, par nom court ou par chemin absolu, sans recompilation. device et compute_type restent en auto : int8 sur CPU, float16 sur CUDA.

  • Modèle choisi par config.yaml ou par --model.
  • Dossier de modèles géré ; le cache Hugging Face n'est qu'un repli.
  • Garde-fou de durée de capture contre une touche bloquée.

Installez-le

Sur Debian ou Ubuntu, une commande et un modèle ; Fedora, openSUSE et Arch Linux ont leurs propres paquets. Le guide complet couvre aussi l’installation depuis les sources, le choix du modèle et les raccourcis du bureau.

Guide d’installation complet →

1

Installer le paquet

Récupérez le .deb sur la page des téléchargements, puis :

sudo apt install ./whispskrid_1.0.1_all.deb

Au premier passage, le paquet crée un environnement virtuel privé et y installe faster-whisper (accès réseau nécessaire à ce moment-là).

2

Télécharger un modèle

Récupérez un modèle Whisper et vérifiez qu'il se charge :

whispskrid --download-model base  # aussi : tiny, small, medium, large-v3

Si aucun modèle n'est présent, l'outil propose le téléchargement au premier lancement.

3

Dicter

Lancez une session dans la langue voulue, puis tenez la touche d'appui :

whispskrid -l fr
4

Depuis les sources (pour développer)

Pour travailler sur le code, exécutez-le depuis un clone git :

git clone https://github.com/RonanDavalan/whispskrid.git
cd whispskrid
python3 -m venv .venv
.venv/bin/pip install -e .
.venv/bin/whispskrid -l fr