lunes, 3 de agosto de 2026

IA y modelos

Cohere lanza Transcribe, un modelo de voz de código abierto

Cohere lanzó Transcribe, un modelo de reconocimiento automático de voz de código abierto que afirma superar a varios competidores en la tabla de clasificación de Hugging Face.

Cohere launches open source Transcribe voice model
Foto: Cohere

El jueves, la empresa de inteligencia artificial empresarial Cohere lanzó Transcribe, marcando su primera incursión en el mercado de modelos de voz. Transcribe es un modelo de reconocimiento automático de voz (ASR, por sus siglas en inglés) de código abierto diseñado para tareas como la toma de notas y el análisis de voz. Construido con 2000 millones de parámetros, el modelo está diseñado para ejecutarse en GPU de grado consumidor, lo que permite a los usuarios que deseen alojar el sistema por su cuenta hacerlo. Según Cohere, Transcribe supera a varios modelos rivales en la tabla de clasificación de ASR de Hugging Face, logrando una tasa de error de palabras (WER) promedio de 5.42, la cual es más baja que la de cualquier otro modelo en la evaluación comparativa. En evaluaciones humanas que analizaron la precisión de la transcripción, la coherencia y la usabilidad, Transcribe logró una tasa de victoria promedio del 61% sobre estos otros modelos. Cohere comparó Transcribe con varios modelos competidores en la tabla de clasificación:

  • Zoom Scribe v1
  • IBM Granite 4.0 1B
  • ElevenLabs Scribe v2
  • Qwen3-ASR-1.7B Speech

El modelo admite actualmente 14 idiomas: inglés, francés, alemán, italiano, español, portugués, griego, neerlandés, polaco, chino, japonés, coreano, vietnamita y árabe. En cuanto a la velocidad de procesamiento, Transcribe puede procesar 525 minutos de audio en un solo minuto, lo cual es alto para su clase de modelo. Sin embargo, el modelo tiene limitaciones notables. Al transcribir portugués, alemán y español, Transcribe quedó por detrás de sus rivales.

Cohere planea integrar Transcribe en North, su plataforma de orquestación de agentes empresariales. La empresa también está poniendo el modelo a disposición de forma gratuita a través de su API, y estará disponible en Model Vault, la plataforma de inferencia gestionada de Cohere. El lanzamiento se produce en medio de una creciente demanda de aplicaciones de toma de notas y dictado como Granola y Wispr Flow. Financieramente, según se informa, Cohere generaba unos ingresos recurrentes anuales (ARR) de USD 240 millones en 2025. El CEO de la empresa emergente, Aidan Gomez, ha indicado que la compañía podría salir a bolsa “pronto”.

Por qué importa

La incursión de Cohere en el reconocimiento de voz de código abierto señala un esfuerzo por capturar la creciente demanda de herramientas automatizadas de toma de notas y dictado, desafiando directamente a los actores establecidos en el espacio de la IA empresarial.