La mayoría de las comparativas de herramientas de IA de podcast a texto arranca con la exactitud. Nosotros revisamos la otra columna: los techos — un tope de duración, un conteo mensual de importaciones, un límite de exportación, una tarjeta gráfica que no tienes. Un techo es un renglón de la tabla de precios del propio proveedor con un número real adentro, y es el renglón que decide si un episodio de setenta minutos siquiera pasa.

Por qué revisamos los techos y no la exactitud

Nuestra postura, no una prueba comparativa: la calidad de la transcripción casi nunca es lo que mata un episodio semanal. Lo que sí lo mata es estructural. Subes una grabación de setenta minutos y el plan la rechaza. Pasa, y se come casi toda la asignación del mes. La transcripción sale limpia y llevarla a algún lado útil te sigue costando una hora.

Esa diferencia importa por lo que sí puedes comprobar antes de pagar. Un porcentaje de exactitud solo te dice algo si el proveedor explica en qué condiciones lo midió — acento, voces encimadas, ruido del cuarto — y si podrías repetir la prueba; fíjate si el que estás leyendo lo hace. Un tope de duración es un renglón de una tabla de precios con un número real adentro. Compra el renglón que sí puedes revisar.

Los techos que publica cada uno

El flujo de reutilización de contenido ya explica cómo cobran las herramientas de contenido y por qué dos páginas de precios rara vez cuadran una junto a la otra. Esta es la otra mitad de la misma página: no la unidad que le pone precio a un archivo, sino el techo que lo rechaza. Tres productos, tres techos distintos, y ninguno tiene que ver con la calidad.

Otter — una subida se mide aparte de una reunión

La página de precios de Otter lista cuatro niveles — Basic, Pro, Business y Enterprise — cobrados por usuario al mes detrás de un selector de facturación mensual y anual. Los renglones que importan para un podcast son los de importación, porque la tabla mide un archivo subido aparte de una reunión. Los archivos importados tienen sus propios minutos al mes, en un renglón titulado “Imported file transcription monthly limit (no rollover)”: 300 minutos por usuario en Basic, 1,200 en Pro y 6,000 en Business y Enterprise — y en los dos primeros niveles una nota al pie marca esa asignación como una bolsa compartida entre todos los tipos de transcripción. También tienen su propio conteo: tres de por vida por usuario en Basic, diez al mes por usuario en Pro, ilimitados más arriba. Un tercer renglón, “Max transcription time per conversation”, publica 30 minutos en Basic, 90 minutos en Pro y cuatro horas en Business y Enterprise; la página no dice si un archivo subido cuenta como una conversación, así que trata ese límite como algo que hay que probar y no dar por hecho. Revisado el 2026-07-28.

Esa separación es lo que hay que notar. La página principal de Otter posiciona el producto alrededor de las reuniones a las que entra y transcribe en vivo, y nombra Zoom, Google Meet y Microsoft Teams. Un archivo que grabaste en otro lado es una acción distinta, con sus propios renglones en la tabla y racionada aparte. Un podcast siempre es esa acción.

Descript — minutos de medios, divididos por editor

Descript publica cinco niveles — Free, Hobbyist, Creator, Business y Enterprise. Free no cuesta nada, Enterprise es solo por cotización (“Custom”), y los tres de en medio traen un precio por persona al mes detrás de un selector de facturación mensual y anual que anuncia “Save up to 35% with annual billing” (hasta 35 por ciento de ahorro con facturación anual). Su medidor de uso se llama “Media minutes (per editor)”, minutos de medios por editor: 60 al mes en Free, 600 en Hobbyist, 1,800 en Creator, 2,400 en Business. Junto a ese medidor hay dos techos más. La exportación de video por liga web dura una hora en Free y Hobbyist contra tres horas en Creator y Business, y el techo publicado de tamaño de archivo va de 1 GB en Free a 10 GB en Hobbyist, 20 GB en Creator y 50 GB en Business. Revisado el 2026-07-28.

Por editor es la frase que hay que retener. La asignación va pegada a cada licencia, no al espacio de trabajo, así que una segunda persona que solo revisa transcripciones trae una asignación que quizá no necesitas. La página principal de Descript vende su modelo de edición como una metáfora — “With Descript, video editing is as easy as typing”, es decir, que con Descript editar video es tan fácil como escribir — y presenta su asistente de IA bajo el nombre Underlord. En esa página no explica la mecánica, así que pruébala en el nivel gratuito en vez de creerle a la metáfora.

Whisper — sin medidor, con una máquina en su lugar

Whisper no es un producto con pantalla de inicio de sesión. Es el modelo de reconocimiento de voz de OpenAI, y su repositorio dice que el código y los pesos del modelo se publican bajo la Licencia MIT. Sin niveles, sin selector de facturación, sin cobro por minuto. El repositorio lista seis tamaños de modelo, desde tiny con 39 millones de parámetros y alrededor de 1 GB de VRAM hasta large con 1.55 mil millones de parámetros y alrededor de 10 GB, más un tamaño turbo con 809 millones y alrededor de 6 GB. Correrlo pide Python, PyTorch y ffmpeg. Revisado el 2026-07-28.

Así que el techo se movió, no desapareció. Ahora es la tarjeta que trae la máquina y la persona que mantiene el proceso andando. No hay asignación de importaciones, y tampoco hay fila de soporte.

Dos de los tres publican un límite que no tiene nada que ver con la calidad de la transcripción, sino con la forma del archivo que entregas. El tercero cambia el límite por hardware. Ninguno de esos límites tiene que ver con la exactitud.

Un episodio de podcast avanzando de izquierda a derecha por cuatro puntos de revisión — tamaño del archivo, tope de duración por conversación, asignación mensual de minutos y duración de exportación — con el techo que puede detenerlo marcado en cada punto
Los techos están en puntos distintos del proceso, y por eso una herramienta que transcribe bien puede aun así rechazar un episodio de noventa minutos.

Por qué el audio de podcast pega en techos que el audio de reuniones esquiva

De los tres, solo uno está construido y cobrado alrededor de reuniones: Otter. Descript se vende como editor de video y Whisper ni siquiera tiene una interfaz para reuniones. Pero una reunión es un objeto distinto a un episodio, y venga de donde venga el techo, son cuatro propiedades del episodio las que se estrellan contra él.

  • Duración — un episodio pasa de la hora con frecuencia, que es justo donde están los topes publicados por conversación.
  • Tamaño — una sesión larga de varias pistas se mide en gigabytes, y el tamaño de subida se publica como su propio techo, aparte de la duración.
  • Cantidad — produces pocos archivos, no muchos, así que una asignación de diez subidas al mes sobra y tres para toda la vida de la cuenta no alcanza.
  • Origen — lo grabaste en otro lado, así que llega como una subida y no como una reunión donde la herramienta estuvo presente capturando en vivo.

Lee esas cuatro contra una tabla de precios y la preselección casi se escribe sola, antes de que alguien mencione una tasa de error de palabras.

Lee tres números de tu último episodio

Antes de abrir una página de precios, abre tu grabación más reciente. Tres números, y los tres son propiedades de tu propio archivo, no algo que publique un proveedor.

  1. 01La duración de tu episodio más largo, en minutos. No el promedio — el más largo. Los topes no se promedian.
  2. 02El tamaño del archivo crudo, en gigabytes. Una sesión de varias pistas es mucho más pesada que el audio que exportas de ella.
  3. 03Episodios por mes, contados como subidas. Este es el número que se topa con una asignación de importaciones.

Anótalos en papel primero. Así una página de precios deja de ser una comparación y se vuelve una revisión de sí o no, que se resuelve mucho más rápido.

En qué se diferencia el audio de un webinar

La transcripción de un webinar carga las palabras y nada de lo que estaba en la pantalla. Una línea que dice “como pueden ver aquí, este número saltó” no se recupera con ninguna exactitud, porque esa información nunca estuvo en el audio. Ningún ajuste de transcripción lo arregla; no es un problema de transcripción.

Los equipos que viven de webinars necesitan una segunda captura corriendo junto a la transcripción — una grabación de pantalla, o alguien anotando los cambios de diapositiva contra las marcas de tiempo mientras pasa. Trátalo como parte de la captura, no como limpieza. Reconectar las palabras con la pantalla después es lento, y es el paso que en silencio se queda sin hacer.

Cuándo alcanza con la transcripción que ya viene incluida

Si grabas unas cuantas veces al año, la transcripción que tu plataforma de grabación ya produce probablemente alcanza, y lo que sobre todo te deja una suscripción es un medidor que vigilar. Una herramienta dedicada empieza a pagarse cuando la transcripción se vuelve una entrada recurrente de otra cosa — el primer paso de un ciclo que corres cada semana, no un documento que alguien lee una vez.

La misma prueba aplica un nivel más arriba. Un equipo que publica de vez en cuando no necesita un sistema formal de reutilización de contenido. Uno que publica cada semana sí, y saltárselo es lo que convierte tener un podcast en tener una carpeta de transcripciones que nadie abrió.

Lo que ninguna hace por ti

El flujo de reutilización de contenido sostiene que la transcripción está prácticamente resuelta y que la verdadera restricción se movió a la selección — una grabación larga contiene solo unos pocos minutos realmente útiles, y encontrarlos es trabajo humano. Este artículo va debajo de esa afirmación, no la repite. Elegir bien aquí te consigue una transcripción de forma confiable y barata. No te consigue los tres pasajes que vale la pena publicar.

Ese es el orden correcto para pensarlo. Elige la herramienta cuyos techos no te frenen, y gasta lo que te ahorraste en la parte que ningún producto mide.

10 al mes
archivos pregrabados que un usuario Pro puede importar en Otter — un medidor aparte de sus asignaciones de minutos (revisado el 2026-07-28)
40 h
la asignación de minutos de medios más alta que publica Descript, medida por editor y no por espacio de trabajo
~10 GB
la VRAM que el repositorio de Whisper indica para su modelo large — la cuenta que sí cobra el autohospedaje

Sigue: el flujo al que alimenta esta transcripción

Relacionado: qué cobran en cambio las herramientas de programación

Agenda una Auditoría de fugas de ingresos gratuita