Clef-omni: el modelo de decisión que ya procesa audio y video
Cloudflare presentó Clef-omni, la nueva versión de su modelo de decisión que acepta audio (wav o mp3) y video (mp4 o webm) además de texto e imágenes. Llega apenas una semana después de Clef y Clef-flash, los primeros modelos entrenados internamente por la compañía, que según Cryptobriefing se lanzaron el 1 de octubre de 2026.
El movimiento rompe con una limitación que arrastraba la categoría: desde la irrupción de Jev, de TypeSafe AI, los modelos de decisión habían sido mayormente de texto. Con Clef-omni, en lugar de encadenar un modelo de transcripción de voz a texto y otro de visión por separado, se envía todo en una sola llamada y el modelo devuelve la decisión.
La diferencia es de arquitectura. Clef-omni se construyó sobre una base Qwen3-Omni-30B-A3B-Instruct de tipo mixture-of-experts (MoE), que ya procesaba texto, imagen, audio y video en un mismo pipeline. Cloudflare conservó el backbone de comprensión y descartó los componentes de salida de texto a voz. En producción, el modelo hace una pasada de prefill sobre todo el payload y puntúa todas las modalidades a la vez.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días¿Qué tan rápido y cuánto cuesta Clef-omni?
Los números de latencia que reporta Cloudflare:
- Decisiones solo de texto: alrededor de 130 ms en la mediana
- Entradas de imagen: alrededor de 150 ms
- Clips de audio: unos pocos cientos de milisegundos
- Un video completo de 21 segundos con sonido: alrededor de 1,5 segundos, todo en una sola llamada a la API
En precio, Clef-omni arranca en US$0,15 por millón de tokens de entrada. Para ponerlo en contexto: Clef se mantiene en US$0,24 por millón y Clef-flash bajó de US$0,09 a US$0,038 por millón de tokens de entrada.
Clef-flash ahora es más barato que Jev (con un asterisco)
La baja de Clef-flash es la noticia más relevante para quien tiene que cuidar el costo por request. Cloudflare dice que optimizó el modelo hasta dejarlo por debajo del precio de Jev, que según Marktechpost se publica a US$0,042 por millón de tokens de entrada.
El asterisco: para llegar a ese precio, Cloudflare recortó la ventana de contexto de la versión alojada de Clef-flash de 64k a 24k tokens. La justificación está en los datos de uso: solo el 0,24% de los requests supera los 24k tokens de entrada. Los pesos en Hugging Face no se tocaron y siguen entrenados para soportar 256k de contexto si se autoaloja el modelo. Quien necesite contexto grande, dice la compañía, debería usar Clef, que mantiene los 64k.
Es una decisión de producto clásica: sacrificar una capacidad que casi nadie usa para bajar el precio de entrada y capturar volumen.
Clef es hasta 2× más rápido
Cloudflare también aceleró la versión alojada de Clef en Workers AI. No hubo nuevos pesos: las mejoras están en la capa de infraestructura de serving.
| Tamaño de entrada | Antes (mediana / p95) | Ahora (mediana / p95) | Mejora |
|---|---|---|---|
| ~800 tokens | 262 / 438 ms | 152 / 351 ms | 1,7× |
| ~3.400 tokens | 616 / 777 ms | 305 / 531 ms | 2,0× |
| ~16.000 tokens | 2.721 / 3.250 ms | 1.635 / 1.805 ms | 1,7× |
Parte del salto viene de migrar el serving a SGLang. Cloudflare trabajó con el equipo de SGLang y envió pull requests para incorporar Clef (PR #42721), que se publicará en SGLang 0.5.22.
¿Cómo se compara Clef-omni con Clef, Clef-flash y Jev?
La tabla de benchmarks que publicó Cloudflare muestra que agregar modalidades tiene un costo en precisión:
| Benchmark | Clef-omni | Clef | Clef-flash | Jev |
|---|---|---|---|---|
| BFCL · case exact | 98,2 | 98,47 | 98,76 | 95,75 |
| API-Bank · accuracy | 92,7 | 91,93 | 93,11 | 88,19 |
| Home appliances · case exact | 69,3 | 82,95 | 97,73 | 52,27 |
| BANKING77 · macro-F1 | 94,8 | 94,20 | 90,93 | 79,74 |
| When2Call · accuracy | 63,3 | 72,37 | 65,58 | 80,97 |
En el benchmark Home appliances, Clef-omni queda en 69,3 frente a 82,95 de Clef y 97,73 de Clef-flash. En When2Call, Jev lidera con 80,97. La lectura: Clef-omni es el modelo para cuando necesitas multimodalidad, no el que elegirías para una clasificación de texto donde Clef o Clef-flash rinden mejor y más barato.
Marktechpost advierte un punto importante: todas las cifras son reportadas por el fabricante y todavía no hay replicación independiente. Lo mismo remarca eWeek. Toma los benchmarks como una hipótesis a validar con tus propios datos, no como un veredicto.
¿Qué significa esto para tu startup?
Si estás construyendo agentes, la categoría de modelos de decisión merece una mirada. La diferencia con un LLM es concreta: en lugar de generar texto que después hay que parsear, el modelo responde un esquema de preguntas tipadas y devuelve una probabilidad por cada respuesta válida. Según Marktechpost, Clef soporta tres tipos de pregunta —noul (sí/no), choice (elegir una opción) y score (puntuar contra una rúbrica)— y admite hasta 64 preguntas y 4 imágenes por request.
Tres acciones concretas:
- Audita tus pipelines multimodales. Si hoy encadenas un modelo de transcripción y otro de visión para decidir algo, cuenta cuántas llamadas haces por request. Clef-omni colapsa eso en una sola llamada, y ahí está el ahorro real, no solo en el precio por token.
- Mide tu ventana de contexto antes de elegir modelo. La baja de Clef-flash a 24k es una ganga si tus requests son cortos, pero te va a morder si procesas documentos largos. Revisa la distribución de tokens de entrada de tu producto antes de migrar.
- Trata la probabilidad como señal, no como permiso. eWeek lo plantea bien: que el modelo clasifique un ticket como urgente no autoriza al agente a tocar datos del cliente. La autorización tiene que vivir en tu aplicación, con permisos acotados.
Y un cuarto punto que suele pasarse por alto: Clef es compatible con la API de Jev. Si ya construiste sobre Jev, migrar es cambiar el endpoint y el nombre del modelo. Eso baja muchísimo el costo de probar.
El contexto: Cloudflare entró al negocio de los modelos
Clef y Clef-flash son los primeros modelos que Cloudflare entrena internamente, aunque Workers AI ya alojaba modelos de terceros. Los pesos están abiertos en Hugging Face bajo licencia Apache 2.0, así que puedes autoalojarlos sin depender del stack de Cloudflare. Según Marktechpost, Clef son 27B parámetros y Clef-flash 9B.
El dato que más dice sobre la velocidad de iteración: según el propio blog, la historia de Clef se armó en menos de una semana. La decisión de entrar al espacio de modelos de decisión se tomó un viernes por la noche, el modelo se entrenó el fin de semana y se lanzó el jueves.
Cloudflare también anunció un servicio de fine-tuning con aprendizaje por refuerzo para ajustar Clef con datos privados, que arranca con sus ingenieros y luego tendrá una plataforma self-serve, según eWeek.
Fuentes
- Cloudflare Blog (fuente original)
- Marktechpost
- Cryptobriefing
- eWeek
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días














