Dictado de voz con pulsar para hablar en Linux, en cualquier aplicación

Mantenga una tecla, hable, suéltela: el texto transcrito se inserta en la ventana con el foco. Impulsado por Whisper a través de faster-whisper, totalmente de código abierto y respetuoso con la privacidad: nada de lo que diga sale nunca de su equipo.

v1.0.1 · en / fr / de / es · 100 % sin conexión · pulsar para hablar

WhispSkrid no es un motor de reconocimiento de voz: es una capa de dictado por línea de comandos construida sobre Whisper, servido por faster-whisper (CTranslate2). Whisper hace la transcripción; este proyecto se encarga de la tecla de pulsar para hablar, de la captura de audio mientras la tecla está mantenida, del socket de control que conecta los atajos del escritorio y de insertar el resultado en la aplicación que tiene el foco.

Ligero, persistente

El modelo Whisper se carga una sola vez en un proceso persistente, y luego la transcripción se produce al soltar la tecla. El modelo base en int8 pesa unos 145 MB en disco y alcanza 0,5–0,6 GB de RAM en CPU (unos 0,3 GB de VRAM en GPU); del tiny al large-v3, la gama va de unos 75 MB a 3 GB en disco. Sin segmentación automática del habla: lo que se graba entre la pulsación y la liberación sale en una sola pasada.

  • Pulsar para hablar es estricto: la captura dura exactamente lo que se mantiene la tecla, sin temporizador ni corte por silencio.
  • La única salvaguarda automática es una duración máxima de captura, alta y configurable, frente a una tecla bloqueada.
  • Una vez que el modelo está presente en local, no se necesita ninguna conexión de red.

Durante la validación se tomaron mediciones reales por máquina en cinco máquinas, que no se publican aquí; los órdenes de magnitud anteriores son la referencia.

Características principales

Pulsar para hablar estricto

La grabación dura exactamente lo que usted mantiene la tecla. Sin corte automático, sin temporizador, sin detección de fin de frase.

Cuatro idiomas

Inglés, francés, alemán y español. -l fr fuerza el idioma pasado a Whisper; sin argumento, Whisper lo detecta solo.

Dos vías de activación

Un escuchador de tecla local con semántica de mantener nativa, o subcomandos vinculados a los atajos globales de su escritorio: la vía que funciona en todas partes bajo Wayland.

Un solo archivo de configuración

Modelo, tecla de pulsar para hablar, dispositivo de audio, portapapeles, tema: todo en config.yaml, sobrescrito clave por clave desde su directorio personal.

Whisper puntúa solo

La puntuación y las mayúsculas vienen del modelo. El posprocesado se limita a recortar los espacios y a forzar una mayúscula inicial.

100 % sin conexión

El modelo se carga desde un directorio local. Ningún dato sale de su equipo.

Todo es configuración

Tecla de pulsar para hablar, modelo, dispositivo de audio, portapapeles: un único archivo YAML legible

config.yaml
hotkeys:
  # Escuchador pynput local (best effort; bajo Wayland,
  # solo ventanas XWayland).
  pynput_enabled: true
  # Mantener = captura; soltar = transcripción.
  push_to_talk: ["shift_r"]

theme:
  ready_message: "GREEN"
  info: "RESET"
  warning: "YELLOW"
  error: "RED"

Tecla y tema

La tecla de pulsar para hablar es reescribible, y el escuchador local se desactiva con un booleano cuando prefiere gobernar desde los atajos del escritorio. Los colores de la salida de terminal se ajustan por tipo de mensaje.

  • Tecla de pulsar para hablar configurable; Mayús derecho por defecto
  • Escuchador local activado o no
  • Color personalizable por tipo de mensaje
config.yaml
backend:
  name: "faster-whisper"
  beam_size: 5

models:
  default: "base"        # tiny | base | small | medium | large-v3
  dir: ""                # vacío => ubicaciones estándar
  device: "auto"         # cpu | cuda | auto
  compute_type: "auto"   # int8 | float16 | auto

capture:
  max_seconds: 300

Motor y modelos

El modelo por defecto se cambia en cualquier momento, por nombre corto o por ruta absoluta, sin recompilar. device y compute_type quedan en auto: int8 en la CPU, float16 en CUDA.

  • Modelo elegido con config.yaml o --model
  • Directorio de modelos gestionado; la caché de Hugging Face es solo un recurso de reserva
  • Salvaguarda de duración de captura frente a una tecla bloqueada

Instálelo

En Debian o Ubuntu, un comando y un modelo; Fedora, openSUSE y Arch Linux tienen sus propios paquetes. La guía completa cubre también la instalación desde el código fuente, la elección del modelo y los atajos del escritorio.

Guía de instalación completa →

1

Instalar el paquete

Obtenga el .deb desde la página de descargas, luego:

sudo apt install ./whispskrid_1.0.1_all.deb

En la primera configuración, el paquete crea un entorno virtual privado e instala faster-whisper en él (se necesita acceso a la red en ese momento).

2

Descargar un modelo

Obtenga un modelo Whisper y compruebe que carga:

whispskrid --download-model base  # también: tiny, small, medium, large-v3

Si no hay ningún modelo presente, la herramienta ofrece la descarga en el primer arranque.

3

Dictar

Inicie una sesión en el idioma que quiera y luego mantenga la tecla de pulsar para hablar:

whispskrid -l es
4

Desde el código fuente (para desarrollar)

Para trabajar en el código, ejecútelo desde un clon de git:

git clone https://github.com/RonanDavalan/whispskrid.git
cd whispskrid
python3 -m venv .venv
.venv/bin/pip install -e .
.venv/bin/whispskrid -l es