Transcribe audio y vídeo a texto, sin que salga de tu navegador
Whisper, la IA de reconocimiento de voz, ejecutándose en tu propio equipo. Obtén texto y subtítulos SRT/VTT de entrevistas, clases, reuniones o vídeos.
- ✓ Gratis y sin límites
- ✓ Sin registro
- ✓ Tus archivos no se suben
- ✓ Exporta TXT · SRT · VTT
- 1 Eliges tu archivo
- 2 Solo la primera vez: se descarga el modelo (~80 MB), un par de minutos
- 3 Transcribe en tu equipo
⚡ Después el modelo queda guardado: las siguientes veces empieza al instante y funciona incluso sin conexión.
Tu grabación está guardada en este navegador. Descárgala si te importa: se pierde al cerrar la pestaña.
Comprueba el idioma y el modelo arriba antes de empezar.
La descarga sigue arriba ↑ Mientras tanto, si te apetece: ¿para qué vas a usar la transcripción? Me ayuda a decidir qué mejorar.
¡Gracias! Sigue la descarga arriba.
Recientes en este dispositivo
Transcripción
Instálalo y no vuelvas a esperar la descarga
Tu navegador no garantiza conservar el modelo: es probable que se descargue otra vez en tu próxima visita. Instalado como aplicación se queda para siempre y arranca al instante, también sin conexión.
Haz clic en cualquier texto para corregirlo. Clic en un tiempo para saltar al audio.
¿Se ha saltado frases o ha entendido mal palabras? Con un modelo mayor mejora bastante. No hay que volver a cargar el archivo.
Identificación de hablantes, transcripción por lotes y actas automáticas.
Anotado (de forma anónima). Estamos midiendo el interés para construirlo. ¡Gracias!
Cómo funciona
-
1 · Elige tu archivo
Audio o vídeo, en cualquier formato habitual. También puedes grabar con el micrófono, capturar una reunión de Meet, Zoom o Teams sin meter ningún bot en la llamada, o transcribir un vídeo o directo que suene en otra pestaña.
-
2 · La IA trabaja en tu equipo
Tu navegador descarga el modelo Whisper una sola vez (queda guardado) y transcribe usando tu propio procesador o gráfica. Nada se sube a ningún servidor.
-
3 · Edita y exporta
Corrige lo que quieras con el audio sincronizado y descarga el resultado en TXT, Markdown, SRT, VTT o JSON.
Privacidad de verdad, no de eslogan
La mayoría de transcriptores "gratis" suben tu audio a sus servidores. Gate32 no puede hacer eso ni queriendo: no tiene servidor de procesado. El reconocimiento de voz se ejecuta íntegramente en tu navegador con WebGPU o WASM. La única descarga es el propio modelo de IA, que queda cacheado: después puedes transcribir incluso sin conexión.
Ideal para material sensible: entrevistas con fuentes, reuniones internas, consultas profesionales, investigación con datos personales. El código es público y verificable.
Gate32 frente a las alternativas
| Gate32 | SaaS de transcripción típico | Apps locales de escritorio | |
|---|---|---|---|
| El audio sale de tu equipo | No, nunca | Sí, se sube a sus servidores | No |
| Precio | Gratis sin límites | Prueba limitada + suscripción | Gratis o compra única |
| Requiere cuenta | No | Sí | No |
| Requiere instalación | No, es una web | No | Sí, y a menudo solo macOS |
| Subtítulos SRT/VTT sin marca de agua | Sí | Normalmente de pago | Según la app |
| Graba una reunión sin meter un bot en la llamada | Sí (Chrome/Edge de escritorio) | No: se une como participante y sube el audio | No, salvo grabando la pantalla |
| Transcribe un vídeo o directo de otra pestaña | Sí | Hay que descargarlo y subirlo | Hay que descargarlo |
| Identificación de hablantes | Todavía no | Sí, en planes de pago | Según la app |
Preguntas frecuentes
¿De verdad es gratis y sin límites?
Sí. Como el procesado ocurre en tu equipo, a nosotros no nos cuesta nada que transcribas más: no hay minutos de prueba, ni topes por archivo, ni marca de agua, ni registro.
¿Cómo transcribo una entrevista confidencial sin subirla a ningún sitio?
Arrastra el archivo aquí. El audio no sale de tu navegador: puedes comprobarlo desconectando la red después de que cargue el modelo — la transcripción sigue funcionando.
¿Puedo generar subtítulos SRT o VTT gratis y sin marca de agua?
Sí. Tras transcribir, pulsa SRT o VTT y descargarás el archivo con los tiempos de cada frase, listo para YouTube, Premiere, DaVinci o cualquier reproductor.
¿Puedo transcribir una reunión de Meet, Zoom o Teams?
Sí, con Chrome o Edge de escritorio: el botón «Grabar otra pestaña» captura el audio que reproduce la pestaña de la videollamada y lo mezcla con tu micrófono, así que funciona aunque lleves auriculares. No entra ningún bot en la llamada. Sirve igual para un vídeo, una clase en directo o una radio que suene en otra pestaña. Cómo funciona.
¿Puedo transcribir un vídeo de YouTube o un directo que esté viendo?
Sí. El botón «Transcribir un vídeo o directo de otra pestaña» captura el sonido que reproduce esa pestaña, sin usar tu micrófono. Va bien con directos, webinars, radios en línea y vídeos sin subtítulos. No funciona con plataformas de streaming de pago (Netflix, Disney+, Prime Video): el navegador impide capturar contenido protegido. Y transcribir para ti no es lo mismo que republicar el texto de una obra ajena.
¿Cómo paso una nota de voz de WhatsApp a texto?
Descarga el audio de la nota y arrástralo aquí. Se acepta el OGG y el OPUS de WhatsApp tal cual, sin convertirlo, y el texto sale con marcas de tiempo por frase. Como el reconocimiento ocurre en tu navegador, la nota no se sube a ningún servidor. Más detalle en notas de voz.
¿Cómo sé de qué partes de la transcripción fiarme?
El reconocimiento de voz nunca avisa de que duda: cuando no entiende algo escribe una frase con su puntuación y su cadencia, que parece correcta. Gate32 marca las líneas con algo anómalo —texto repetido, más palabras de las que caben en el tiempo que ocupan, segundos de audio convertidos en dos palabras— y dice cuántas son. Pulsa su marca de tiempo y salta a ese punto del audio. No se afirma que estén mal: se señala dónde mirar.
¿Qué precisión tiene? ¿Qué idiomas soporta?
Usa Whisper de OpenAI en tu dispositivo, con tres tamaños de modelo. Puedes elegir entre 47 idiomas o dejar que lo detecte solo. El modo Preciso ofrece muy buena calidad en español, inglés y las demás lenguas mayoritarias; en idiomas con menos datos de entrenamiento (vietnamita, tailandés, urdu…) los modelos pequeños pierden bastante y conviene subir de tamaño — la app te lo avisa al elegir. Audio con mucho ruido o solapamiento de voces reduce la precisión, como en cualquier transcriptor.
¿Cuánto tarda?
La primera vez incluye descargar el modelo (~50–250 MB) y prepararlo, lo que puede llevar unos minutos; todo queda cacheado y las siguientes transcripciones empiezan casi al instante. La velocidad de transcripción depende de tu equipo: con gráfica compatible con WebGPU (Chrome o Edge recientes) suele ser más rápida que el tiempo real. En equipos modestos funciona igualmente (WASM), pero tarda más: usa el modelo Rápido.
¿Sirve para archivos largos, como una clase de dos horas?
Sí, procesa por bloques con progreso visible. Para sesiones muy largas (más de ~90 minutos) conviene un equipo con memoria holgada; si algo falla, prueba con el modelo Rápido o divide el archivo.
Tengo una plataforma, ¿puedo ofrecer esto a mis usuarios?
Sí, con un iframe. No hay SDK, ni clave de API, ni servidor al que llamar, y como la transcripción ocurre en el navegador de cada usuario, ni te cuesta por minuto ni su audio pasa por tus servidores. Está explicado con el código, los parámetros y los límites en integrar Gate32 en tu plataforma.
¿En qué se diferencia de Otter, Notta o HappyScribe?
Esas herramientas procesan tu audio en sus servidores y limitan el plan gratuito (minutos, número de archivos, funciones). Gate32 es local: privacidad verificable, sin límites y sin cuenta. A cambio, funciones de servidor como la identificación de hablantes aún no están disponibles (estamos midiendo el interés).