Dictado de voz con pulsar para hablar en Linux, en cualquier aplicación
Mantenga una tecla, hable, suéltela: el texto transcrito se inserta en la ventana con el foco. Impulsado por Whisper a través de faster-whisper, totalmente de código abierto y respetuoso con la privacidad: nada de lo que diga sale nunca de su equipo.
v1.0.1 · en / fr / de / es · 100 % sin conexión · pulsar para hablar
WhispSkrid no es un motor de reconocimiento de voz: es una capa de dictado por línea de comandos construida sobre Whisper, servido por faster-whisper (CTranslate2). Whisper hace la transcripción; este proyecto se encarga de la tecla de pulsar para hablar, de la captura de audio mientras la tecla está mantenida, del socket de control que conecta los atajos del escritorio y de insertar el resultado en la aplicación que tiene el foco.
Ligero, persistente
El modelo Whisper se carga una sola vez en un proceso persistente, y luego la
transcripción se produce al soltar la tecla. El modelo base en
int8 pesa unos 145 MB en disco y alcanza 0,5–0,6 GB de RAM
en CPU (unos 0,3 GB de VRAM en GPU); del tiny al
large-v3, la gama va de unos 75 MB a 3 GB en disco. Sin segmentación automática del habla: lo que se graba entre la
pulsación y la liberación sale en una sola pasada.
- Pulsar para hablar es estricto: la captura dura exactamente lo que se mantiene la tecla, sin temporizador ni corte por silencio.
- La única salvaguarda automática es una duración máxima de captura, alta y configurable, frente a una tecla bloqueada.
- Una vez que el modelo está presente en local, no se necesita ninguna conexión de red.
Durante la validación se tomaron mediciones reales por máquina en cinco máquinas, que no se publican aquí; los órdenes de magnitud anteriores son la referencia.
Características principales
Pulsar para hablar estricto
La grabación dura exactamente lo que usted mantiene la tecla. Sin corte automático, sin temporizador, sin detección de fin de frase.
Cuatro idiomas
Inglés, francés, alemán y español. -l fr fuerza el idioma pasado a Whisper; sin argumento, Whisper lo detecta solo.
Dos vías de activación
Un escuchador de tecla local con semántica de mantener nativa, o subcomandos vinculados a los atajos globales de su escritorio: la vía que funciona en todas partes bajo Wayland.
Un solo archivo de configuración
Modelo, tecla de pulsar para hablar, dispositivo de audio, portapapeles, tema: todo en config.yaml, sobrescrito clave por clave desde su directorio personal.
Whisper puntúa solo
La puntuación y las mayúsculas vienen del modelo. El posprocesado se limita a recortar los espacios y a forzar una mayúscula inicial.
100 % sin conexión
El modelo se carga desde un directorio local. Ningún dato sale de su equipo.
Todo es configuración
Tecla de pulsar para hablar, modelo, dispositivo de audio, portapapeles: un único archivo YAML legible
hotkeys:
# Escuchador pynput local (best effort; bajo Wayland,
# solo ventanas XWayland).
pynput_enabled: true
# Mantener = captura; soltar = transcripción.
push_to_talk: ["shift_r"]
theme:
ready_message: "GREEN"
info: "RESET"
warning: "YELLOW"
error: "RED"
Tecla y tema
La tecla de pulsar para hablar es reescribible, y el escuchador local se desactiva con un booleano cuando prefiere gobernar desde los atajos del escritorio. Los colores de la salida de terminal se ajustan por tipo de mensaje.
- Tecla de pulsar para hablar configurable; Mayús derecho por defecto
- Escuchador local activado o no
- Color personalizable por tipo de mensaje
backend:
name: "faster-whisper"
beam_size: 5
models:
default: "base" # tiny | base | small | medium | large-v3
dir: "" # vacío => ubicaciones estándar
device: "auto" # cpu | cuda | auto
compute_type: "auto" # int8 | float16 | auto
capture:
max_seconds: 300
Motor y modelos
El modelo por defecto se cambia en cualquier momento, por nombre corto o por ruta absoluta, sin recompilar. device y compute_type quedan en auto: int8 en la CPU, float16 en CUDA.
- Modelo elegido con
config.yamlo--model - Directorio de modelos gestionado; la caché de Hugging Face es solo un recurso de reserva
- Salvaguarda de duración de captura frente a una tecla bloqueada
Instálelo
En Debian o Ubuntu, un comando y un modelo; Fedora, openSUSE y Arch Linux tienen sus propios paquetes. La guía completa cubre también la instalación desde el código fuente, la elección del modelo y los atajos del escritorio.
Instalar el paquete
Obtenga el .deb desde la página de descargas, luego:
sudo apt install ./whispskrid_1.0.1_all.debEn la primera configuración, el paquete crea un entorno virtual privado e instala faster-whisper en él (se necesita acceso a la red en ese momento).
Descargar un modelo
Obtenga un modelo Whisper y compruebe que carga:
whispskrid --download-model base # también: tiny, small, medium, large-v3Si no hay ningún modelo presente, la herramienta ofrece la descarga en el primer arranque.
Dictar
Inicie una sesión en el idioma que quiera y luego mantenga la tecla de pulsar para hablar:
whispskrid -l esDesde el código fuente (para desarrollar)
Para trabajar en el código, ejecútelo desde un clon de git:
git clone https://github.com/RonanDavalan/whispskrid.git
cd whispskrid
python3 -m venv .venv
.venv/bin/pip install -e .
.venv/bin/whispskrid -l es