Anleitungen: installieren und starten

Die zwei Installationswege – natives Paket oder Git-Klon –, Diktieren in vier Sprachen und die Push-to-Talk-Taste zur Steuerung einer Sitzung.

Native Pakete für Debian 12 und 13, Ubuntu 22.04 und 24.04, Fedora 42, openSUSE Leap 15.6 und Arch Linux. Es gibt zwei Installationswege; wählen Sie pro Rechner einen aus.

Installation über ein Paket

# Debian 12 und 13, Ubuntu 22.04 und 24.04 und deren Derivate
sudo apt install ./whispskrid_1.0.1_all.deb

# Fedora 42
sudo dnf install ./whispskrid-1.0.1-1.fc42.noarch.rpm

# openSUSE Leap 15.6
sudo zypper install ./whispskrid-1.0.1-1.leap156.noarch.rpm

# Arch Linux
sudo pacman -U whispskrid-1.0.1-1-any.pkg.tar.zst

Der Befehl whispskrid steht danach in Ihrem PATH. Beim ersten Start baut er eine private virtuelle Umgebung auf und installiert faster-whisper einmalig; die benutzerbezogene Konfigurationsdatei wird unter ~/.config/whispskrid/config.yaml aus der mitgelieferten Vorlage erzeugt. Das Whisper-Modell ist nicht enthalten — siehe Downloads für den Paketinhalt und den Ablageort des Modells.

Installation aus einem Git-Checkout

Für die Arbeit am Code oder auf einer Distribution ohne das Paket:

git clone https://github.com/RonanDavalan/whispskrid.git
cd whispskrid
python3 -m venv .venv
.venv/bin/pip install -e .
.venv/bin/whispskrid --diagnose

Starten Sie es mit .venv/bin/whispskrid. Die Systempakete portaudio19-dev, gettext und ein Injektions-Backend (siehe unten) sind weiterhin erforderlich.

Diktiersprachen

Vier Sprachen werden unterstützt: Englisch, Französisch, Deutsch und Spanisch. Ein einziges mehrsprachiges Whisper-Modell deckt sie alle ab — es gibt kein Modell pro Sprache. Die aktive Sprache wird über -l gewählt, sonst über die Systemsprache, sonst über die Autoerkennung von Whisper.

whispskrid -l de

Das Modell liegt in ~/.local/share/whispskrid/whisper-models/. Der Befehl lädt es herunter und prüft, dass es sich laden lässt:

whispskrid --download-model base

Beim ersten Start ohne Modell bietet er denselben Download an. Verfügbare Modelle: tiny, base (Vorgabe), small, medium, large-v3.

Eine Sitzung steuern

WhispSkrid arbeitet nach dem Push-to-Talk-Prinzip: Sie halten eine Taste, sprechen, lassen los; der transkribierte Text wird in das Fenster mit dem Fokus eingefügt. Es gibt keine automatische Unterbrechung — der einzige Schutz ist capture.max_seconds (Vorgabe 300). Die Standardtaste ist die rechte Umschalttaste (shift_r), einstellbar über hotkeys.push_to_talk.

Der lokale Tastenlauscher (pynput) erreicht nur X11- und XWayland-Fenster. Unter Wayland oder für ein globales Desktop-Kürzel binden Sie stattdessen diese Unterbefehle, die der laufenden Sitzung über den Steuer-Socket übergeben werden:

whispskrid --dictate       # Aufnahme starten
whispskrid --dictate-stop  # stoppen, transkribieren, einfügen
whispskrid --toggle        # je nach Zustand das eine oder andere
whispskrid --cancel        # laufende Aufnahme verwerfen

Ein Desktop-Kürzel überträgt kein Tastenhalten, daher rahmen auf diesem Weg --dictate und --dictate-stop das Diktat ein. Satzzeichen werden nicht gesprochen — Whisper setzt Satzzeichen und Satzanfangsgroßschreibung selbst.

whispskrid --diagnose meldet Sitzungstyp, Injektions-Backend, Audiogerät, Backend- und Modellstatus und beendet sich dann.

Wayland und X11

Text wird über die Zwischenablage eingefügt, es braucht also eine Tastatur-Engine und ein Zwischenablage-Werkzeug. Die Engine wird einmalig beim Start geprüft: zuerst ydotool (Treiberebene, über den Daemon ydotoold), dann xdotool, dann der degradierte Modus (Text bleibt im Terminal, kein Tastendruck wird gesendet). Das Zwischenablage-Werkzeug ist wl-clipboard unter Wayland (immer erforderlich) und xclip unter X11. Die nativen Pakete ziehen diese mit; eine Quellinstallation fügt sie selbst hinzu. Ohne Zwischenablage-Werkzeug fügt das Einfügen erneut ein, was zuletzt von Hand kopiert wurde. ydotool braucht als verwendete Engine den Daemon ydotoold und die Mitgliedschaft in der Gruppe input (nach dem Hinzufügen ab- und wieder anmelden). Der pynput-Lauscher erreicht nur X11- und XWayland-Fenster; binden Sie unter Wayland die obigen Unterbefehle an die Kürzeleinstellungen Ihres Desktops, damit sie jedes Fenster abdecken.

Vollständige Referenz

Jeder Konfigurationsschlüssel, die Suchkaskade für das Modell und der Steuer-Socket sind im docs/ des Projekts dokumentiert: configuration.md und die Handbuchseite whispskrid(1), jeweils in den vier Sprachen. Siehe Architektur dazu, wie die Teile zusammenwirken.

In diesem Abschnitt

  • Downloads — Welche Datei Sie nehmen sollten, je nachdem, ob Sie WhispSkrid nutzen oder verändern wollen, wie Sie das Erhaltene prüfen, und was der apt-Hinweis bedeutet.