El Problema
Seguir conferencias en ingles en tiempo real requiere atencion constante. Pausar para traducir rompe el flujo. Los servicios de traduccion en vivo tienen costo mensual y requieren integraciones especificas por plataforma.
La Solucion
Un pipeline multi-threaded que captura cualquier audio del sistema (Discord, Zoom, YouTube, cualquier app) y muestra subtitulos bilingues en terminal:
- AudioCapture - WASAPI Loopback captura audio del sistema sin software extra
- Transcriber - Faster-Whisper transcribe localmente (4x mas rapido que Whisper, gratis)
- Translator - deep-translator (Google Translate) traduce sin API key
- Display - Terminal con colores ANSI muestra ambos idiomas en tiempo real
- Logger - Guarda transcripciones automaticamente
Todo corre local excepto la traduccion. Sin costos de API para transcripcion.
Modo Offline
Ademas del modo live, procesa videos completos:
- YouTube y 1000+ sitios via yt-dlp
- Archivos locales (mp4, mp3, wav, etc.)
- Output: archivos .txt, .srt y .vtt en ambos idiomas
- Multi-idioma: soporta
--source-langpara audio en cualquier idioma
Arquitectura
Pipeline de queues con 5 threads independientes: capture, transcriber, translator, logger, display. Cada componente es un modulo aislado que se comunica via queue.Queue. Shutdown coordinado con signal handlers.
Decisiones Tecnicas
- Faster-Whisper sobre Whisper original: usa CTranslate2, 4x mas rapido en CPU, menor uso de memoria
- WASAPI Loopback sobre virtual audio cable: nativo de Windows, zero config
- deep-translator sobre APIs de pago: gratis, sin limites practicos para uso personal
- VAD filter activo: Whisper solo procesa cuando detecta voz, reduce ruido y CPU