Transcribe audio y vídeo a texto, sin que salga de tu navegador

Whisper, la IA de reconocimiento de voz, ejecutándose en tu propio equipo. Obtén texto y subtítulos SRT/VTT de entrevistas, clases, reuniones o vídeos.

Arrastra un archivo de audio o vídeo o haz clic para elegirlo · MP3, WAV, M4A, OGG, MP4, WEBM…
  1. 1 Eliges tu archivo
  2. 2 Solo la primera vez: se descarga el modelo (~80 MB), un par de minutos
  3. 3 Transcribe en tu equipo

⚡ Después el modelo queda guardado: las siguientes veces empieza al instante y funciona incluso sin conexión.

🔒 El procesado es 100 % local: el archivo no se sube a ningún servidor.

Cómo funciona

  1. 1 · Elige tu archivo

    Audio o vídeo, en cualquier formato habitual. También puedes grabar con el micrófono, capturar una reunión de Meet, Zoom o Teams sin meter ningún bot en la llamada, o transcribir un vídeo o directo que suene en otra pestaña.

  2. 2 · La IA trabaja en tu equipo

    Tu navegador descarga el modelo Whisper una sola vez (queda guardado) y transcribe usando tu propio procesador o gráfica. Nada se sube a ningún servidor.

  3. 3 · Edita y exporta

    Corrige lo que quieras con el audio sincronizado y descarga el resultado en TXT, Markdown, SRT, VTT o JSON.

Privacidad de verdad, no de eslogan

La mayoría de transcriptores "gratis" suben tu audio a sus servidores. Gate32 no puede hacer eso ni queriendo: no tiene servidor de procesado. El reconocimiento de voz se ejecuta íntegramente en tu navegador con WebGPU o WASM. La única descarga es el propio modelo de IA, que queda cacheado: después puedes transcribir incluso sin conexión.

Ideal para material sensible: entrevistas con fuentes, reuniones internas, consultas profesionales, investigación con datos personales. El código es público y verificable.

Gate32 frente a las alternativas

Comparativa de Gate32 con transcriptores SaaS y aplicaciones de escritorio
Gate32 SaaS de transcripción típico Apps locales de escritorio
El audio sale de tu equipoNo, nuncaSí, se sube a sus servidoresNo
PrecioGratis sin límitesPrueba limitada + suscripciónGratis o compra única
Requiere cuentaNoNo
Requiere instalaciónNo, es una webNoSí, y a menudo solo macOS
Subtítulos SRT/VTT sin marca de aguaNormalmente de pagoSegún la app
Graba una reunión sin meter un bot en la llamadaSí (Chrome/Edge de escritorio)No: se une como participante y sube el audioNo, salvo grabando la pantalla
Transcribe un vídeo o directo de otra pestañaHay que descargarlo y subirloHay que descargarlo
Identificación de hablantesTodavía noSí, en planes de pagoSegún la app

Preguntas frecuentes

¿De verdad es gratis y sin límites?

Sí. Como el procesado ocurre en tu equipo, a nosotros no nos cuesta nada que transcribas más: no hay minutos de prueba, ni topes por archivo, ni marca de agua, ni registro.

¿Cómo transcribo una entrevista confidencial sin subirla a ningún sitio?

Arrastra el archivo aquí. El audio no sale de tu navegador: puedes comprobarlo desconectando la red después de que cargue el modelo — la transcripción sigue funcionando.

¿Puedo generar subtítulos SRT o VTT gratis y sin marca de agua?

Sí. Tras transcribir, pulsa SRT o VTT y descargarás el archivo con los tiempos de cada frase, listo para YouTube, Premiere, DaVinci o cualquier reproductor.

¿Puedo transcribir una reunión de Meet, Zoom o Teams?

Sí, con Chrome o Edge de escritorio: el botón «Grabar otra pestaña» captura el audio que reproduce la pestaña de la videollamada y lo mezcla con tu micrófono, así que funciona aunque lleves auriculares. No entra ningún bot en la llamada. Sirve igual para un vídeo, una clase en directo o una radio que suene en otra pestaña. Cómo funciona.

¿Puedo transcribir un vídeo de YouTube o un directo que esté viendo?

Sí. El botón «Transcribir un vídeo o directo de otra pestaña» captura el sonido que reproduce esa pestaña, sin usar tu micrófono. Va bien con directos, webinars, radios en línea y vídeos sin subtítulos. No funciona con plataformas de streaming de pago (Netflix, Disney+, Prime Video): el navegador impide capturar contenido protegido. Y transcribir para ti no es lo mismo que republicar el texto de una obra ajena.

¿Cómo paso una nota de voz de WhatsApp a texto?

Descarga el audio de la nota y arrástralo aquí. Se acepta el OGG y el OPUS de WhatsApp tal cual, sin convertirlo, y el texto sale con marcas de tiempo por frase. Como el reconocimiento ocurre en tu navegador, la nota no se sube a ningún servidor. Más detalle en notas de voz.

¿Cómo sé de qué partes de la transcripción fiarme?

El reconocimiento de voz nunca avisa de que duda: cuando no entiende algo escribe una frase con su puntuación y su cadencia, que parece correcta. Gate32 marca las líneas con algo anómalo —texto repetido, más palabras de las que caben en el tiempo que ocupan, segundos de audio convertidos en dos palabras— y dice cuántas son. Pulsa su marca de tiempo y salta a ese punto del audio. No se afirma que estén mal: se señala dónde mirar.

¿Qué precisión tiene? ¿Qué idiomas soporta?

Usa Whisper de OpenAI en tu dispositivo, con tres tamaños de modelo. Puedes elegir entre 47 idiomas o dejar que lo detecte solo. El modo Preciso ofrece muy buena calidad en español, inglés y las demás lenguas mayoritarias; en idiomas con menos datos de entrenamiento (vietnamita, tailandés, urdu…) los modelos pequeños pierden bastante y conviene subir de tamaño — la app te lo avisa al elegir. Audio con mucho ruido o solapamiento de voces reduce la precisión, como en cualquier transcriptor.

¿Cuánto tarda?

La primera vez incluye descargar el modelo (~50–250 MB) y prepararlo, lo que puede llevar unos minutos; todo queda cacheado y las siguientes transcripciones empiezan casi al instante. La velocidad de transcripción depende de tu equipo: con gráfica compatible con WebGPU (Chrome o Edge recientes) suele ser más rápida que el tiempo real. En equipos modestos funciona igualmente (WASM), pero tarda más: usa el modelo Rápido.

¿Sirve para archivos largos, como una clase de dos horas?

Sí, procesa por bloques con progreso visible. Para sesiones muy largas (más de ~90 minutos) conviene un equipo con memoria holgada; si algo falla, prueba con el modelo Rápido o divide el archivo.

Tengo una plataforma, ¿puedo ofrecer esto a mis usuarios?

Sí, con un iframe. No hay SDK, ni clave de API, ni servidor al que llamar, y como la transcripción ocurre en el navegador de cada usuario, ni te cuesta por minuto ni su audio pasa por tus servidores. Está explicado con el código, los parámetros y los límites en integrar Gate32 en tu plataforma.

¿En qué se diferencia de Otter, Notta o HappyScribe?

Esas herramientas procesan tu audio en sus servidores y limitan el plan gratuito (minutos, número de archivos, funciones). Gate32 es local: privacidad verificable, sin límites y sin cuenta. A cambio, funciones de servidor como la identificación de hablantes aún no están disponibles (estamos midiendo el interés).