Domingo por la mañana, 19 de abril de 2026. Estaba en mi segundo café viendo a un robot humanoide de 1,20 metros en Pekín cruzar la meta de una media maratón en 50 minutos y 26 segundos —más rápido que el récord mundial humano de Jacob Kiplimo—, con un cambio de batería a mitad de carrera que parecía sacado de una parada en boxes de F1. El lunes por la noche, Moonshot lanzó Kimi K2.6 en Hugging Face. Para el martes, Alibaba ya había publicado la vista previa de Qwen 3.6 Max. Polymarket estaba cotizando GPT-5.5 —nombre en clave "Spud"— con una probabilidad aproximada del 74% de lanzamiento para el 23 de abril.
Un solo fin de semana. Un robot superó un récord humano. Dos modelos insignia de código se pusieron en marcha. El supuesto próximo modelo de OpenAI empezó a cotizarse como un contrato de futuros. Y en algún lugar de Hangzhou, una entrada de Medium afirmaba que DeepSeek v4 había alcanzado un 83,7% en SWE-Bench Verified con una arquitectura de 1T de parámetros que nadie ha verificado de forma independiente.
Este es el análisis de modelos de IA de abril de 2026 que me hubiera gustado leer antes de tener que escribirlo yo mismo. Porque la mayoría de los resúmenes que he visto esta semana hacen una de dos cosas inútiles: reescriben las notas de prensa y le ponen un TL;DR encima, o tratan benchmarks filtrados de Medium como si fueran datos confirmados. Llevo días ejecutando estos modelos en mi propio hardware, pagando las llamadas de API y comprobando qué afirmaciones sobreviven al contacto con cargas de trabajo reales. Lo que sigue es señal frente a ruido—la calibración que habría querido tener el lunes.
Empiezo por el modelo que realmente me hizo replantear mi stack.
Kimi K2.6: El modelo open-source que me hizo cancelar un workflow que había estado ejecutando durante seis meses
Moonshot AI lanzó Kimi K2.6 el 20 de abril de 2026. Leí el anuncio igual que leo cada uno de esos titulares de “modelo open-source supera a Claude” en los últimos dieciocho meses: con escepticismo, y con un plan a medio formar para probarlo en un repositorio desechable después de cenar.
Entonces vi los precios. Entonces lancé la primera prueba. Entonces cancelé el pipeline Opus-only que llevaba ejecutando en un trabajo de agente de largo recorrido desde hacía seis meses.
Los números que realmente importan
Kimi K2.6 sale listado a $0.60 por millón de tokens de entrada y $2.50 por millón de tokens de salida. Claude Opus 4.7 tiene un precio de $5.00 por millón de tokens de entrada y $25.00 por millón de salida. Eso significa que es aproximadamente 8× más barato en la entrada y 10× más barato en la salida. Una ejecución de agente con 20,000 tokens de entrada y 8,000 de salida, que cuesta cerca de $0.30 en Opus 4.7, cuesta aproximadamente $0.03 en K2.6. En un pipeline que corre 400 de esas al día, la diferencia es entre una factura diaria de API de $36 y una de $3.60 — $11,000 al año que de repente no salen de mi bolsillo.
Pero el precio solo fue el anzuelo. La verdadera razón por la que moví una carga de trabajo crítica fue la resistencia. Kimi K2.6 fue construido desde cero alrededor de una convicción: el cuello de botella para la IA agente no es el razonamiento bruto, sino la capacidad de seguir llamando herramientas, corrigiendo errores y mantener coherencia durante sesiones de horas sin degradarse. Especificación oficial de Moonshot: escalado de enjambre con 300 subagentes, más de 4,000 pasos coordinados, sesiones de más de 12 horas.
No creía en esos números hasta que intenté romperlos.
Cómo se ven realmente 4,000 llamadas a herramientas en la práctica
La prueba que realicé: apunté K2.6 a un monolito Laravel mediano (alrededor de 38,000 líneas distribuidas en 420 archivos) y le pedí que auditara toda la base de código en busca de patrones N+1 en consultas, que generara ramas de parches para cada uno, corriese el suite de pruebas tras cada parche y revirtiera cualquier cambio que rompiera algo. El trabajo se ejecutó durante 11 horas y 40 minutos en mi M3 Ultra (1T parámetros, cuantizado, ejecutándose localmente — sin facturas de API, solo electricidad).
Abrió 318 parches por separado. 287 pasaron las pruebas y se mantuvieron. 31 fueron revertidos. El informe final de auditoría tenía 9,400 palabras y detectó un sutil bug de carga ansiosa (eager-loading) en Eloquent dentro de un controlador de reportes que yo mismo había desplegado ocho meses antes y nunca noté: un loop sobre relaciones de usuario generaba una consulta por fila en el dashboard de administración. La misma auditoría en Opus 4.7 me habría costado cerca de $340 en tarifas de API y habría requerido lógica de orquestación que nunca programé. Con K2.6 local, me costó una sesión nocturna y unos $4.80 en electricidad.
En generación de código pura, en benchmarks con casos de prueba conocidos, Opus 4.7 sigue teniendo una ventaja real. Eso no lo discuto. Pero para cargas de trabajo que implican uso de herramientas, navegación, o coordinación de múltiples pasos — esos escenarios donde “cuánto tiempo puede seguir el modelo” importa más que “cuán ingeniosa es la respuesta individual” — K2.6 es competitivo o superior. En HLE-Full para razonamiento agente con herramientas, obtiene un 54.0% frente al 52.1% de GPT-5.4 y el 53.0% de Claude Opus 4.6.
Los pesos están publicados en Hugging Face bajo una Licencia MIT modificada. Ese es el aspecto que la comparación de precios no refleja. Puedes ejecutar este modelo en una VPC asegurada sin que ningún dato salga de tu infraestructura. Para cualquiera que construya en industrias reguladas — salud, finanzas, legal — solo eso ya es todo el argumento.
Hay una concesión que nadie te cuenta en la comparación de titulares, y volveré a ello en la sección de limitaciones sinceras. Pero antes, el modelo que aún no ha salido pero está a punto, y la razón por la que mi feed ha sido pura especulación durante tres semanas.
GPT-5.5 "Spud": Qué Se Sabe Realmente Versus Lo Que Se Afirma en Twitter
Spud es el nombre en clave interno para el próximo modelo principal de OpenAI y, al momento de escribir esto el 21 de abril de 2026, aún no ha sido lanzado. Quiero dejar eso muy claro porque la mitad del contenido que he visto esta semana lo trata como si ya estuviera disponible en la API.
Esto es lo que realmente está confirmado, con fuentes: Sam Altman dijo a los empleados que el preentrenamiento terminó alrededor del 24 de marzo de 2026. Lo describió como "un modelo muy potente" que podría "acelerar realmente la economía". Actualmente, el modelo está en la fase de evaluación de seguridad de OpenAI. Polymarket —donde los usuarios apuestan dinero real a sus predicciones de fechas— asigna una probabilidad de entre el 70% y 78% de lanzamiento antes del 30 de abril de 2026, siendo el 23 de abril el día con mayor volumen de apuestas individuales.
Así que el lanzamiento es, casi con certeza, esta semana o la próxima. ¿Las especificaciones, capacidades y todo lo demás que circula? Mucho menos claro.
El Rumor del A/B Testing
La afirmación que más veces he visto es que Spud está siendo probado con A/B testing dentro de ChatGPT frente a Opus 4.7 y Gemini 3.1 Pro, y que está superando a ambos en tareas de codificación, generación de SVG, 3D y desarrollo de juegos, además de usar menos tokens por respuesta. He visto capturas de pantalla. He visto clips de demostración —incluido uno donde se muestra la creación de una app web tipo Excel-clon desde una sola indicación.
No he podido verificar de forma independiente la afirmación sobre el A/B testing. Las capturas concuerdan con la forma en que OpenAI ha implementado históricamente las shadow evals, y el comportamiento del modelo en los clips filtrados es coherente con un salto generacional más allá de GPT-5.4. Pero "coherente con" no es "confirmado". Si ves a alguien asegurando que Spud supera de manera definitiva a Opus 4.7 en SWE-bench Pro ahora mismo, se está adelantando a las pruebas.
Lo Que Realmente Estoy Observando
Tres cosas para el día de lanzamiento:
- Números reales en SWE-bench Pro frente a Opus 4.7 — el benchmark que Anthropic utilizó para posicionar a Opus 4.7 con un 64.3%.
- Tokens por respuesta en tareas de codificación — la afirmación de "mayor eficiencia de tokens" es la que más probablemente será suavizada si no se sostiene.
- Si se lanza en una super-app unificada o como API independiente. Los primeros reportes apuntan a que Spud se está diseñando como el motor de un ChatGPT unificado —codificación, investigación, agentes, memoria en una sola interfaz. Si esto es cierto, el precio y los límites de uso importan aún más que las diferencias en benchmarks.
Este último punto conecta directamente con lo que OpenAI ya lanzó la semana pasada, y que la mayoría pasó por alto porque todos estaban esperando a Spud.
La actualización de la super app Codex de la que casi nadie está hablando
El 16 de abril de 2026, OpenAI lanzó la mayor actualización de Codex desde su llegada al escritorio. Se denomina "Codex para (casi) todo", y representa lo que la propia OpenAI describió como la "primera fase" de una ambición más amplia de super app.
La funcionalidad principal es el uso del ordenador: Codex ahora puede ver tu pantalla de macOS, controlar el cursor, hacer clic y escribir en otras aplicaciones de Mac. Inicialmente disponible solo para macOS. Todavía no está disponible en la UE, Reino Unido ni Suiza. El desempeño es aproximadamente el que cabría esperar de un asistente administrativo junior que nunca ha utilizado esa aplicación concreta: brillante en flujos de trabajo genéricos, torpe en los personalizados, pero mejorando rápidamente.
Sin embargo, el uso del ordenador no es lo que transformó mi flujo de trabajo. Lo que realmente lo cambió fue Chronicle.
Chronicle: El sistema de memoria que lee tu pantalla
Chronicle es un nuevo sistema de memoria en la app de escritorio de Codex que construye contexto a partir del contenido reciente de la pantalla. No de lo que escribes en el chat, sino de lo que realmente ocurre en tu display. Cuando comienzas una nueva conversación con Codex, ya sabe qué estabas viendo hace cinco minutos, qué comandos ejecutaste en el terminal, qué mensajes de error descartaste.
La primera vez que lo usé, tecleé el prompt "ayúdame a depurar esto". Codex respondió con el archivo exacto y el número de línea del error de TypeScript que acababa de ver en mi panel de VS Code treinta segundos antes. No mencioné el archivo, la línea, el error ni TypeScript. Todo lo extrajo del historial de mi pantalla.
Es la función de memoria más potente que he probado en cualquier herramienta de IA, y también la más inquietante. La documentación oficial de OpenAI indica claramente que el contenido de la pantalla se procesa en la nube, no localmente y sin cifrado de extremo a extremo. Por esa razón, ejecuto Chronicle solo en una máquina dedicada para el trabajo. En mi portátil personal, permanece desactivado. Punto final.
Precios: Chronicle está disponible solo en el plan Pro ($100/mes), exclusivamente para macOS, y Codex ya cuenta con 3 millones de usuarios activos semanales en abril de 2026. La generación de imágenes corre sobre GPT-Image-1.5 e integra la misma app. Los más de 90 plugins incluyen lo que OpenAI describe como "skills, integraciones de aplicaciones y servidores MCP", lo que significa que Codex ahora utiliza el mismo protocolo MCP que emplea el ecosistema de Anthropic. Esa interoperabilidad es, en realidad, una de las mayores novedades del mes, aunque es el tipo de avance que no se viraliza en X porque no puedes sacar una captura de pantalla de un apretón de manos de protocolo.
Antes de pasar a los rumores, queda un modelo más que realmente se lanzó esta semana y está redefiniendo en la práctica lo que significa "agentic coding model".
Vista previa de Qwen 3.6 Max: Alibaba se lleva la corona del código un martes
Alibaba lanzó Qwen 3.6 Max Preview el 20 de abril de 2026, el mismo día que Kimi K2.6. Esto no es una coincidencia. Ambos laboratorios apuntan a los mismos rankings de benchmarks con modelos de producción, y el momento del lanzamiento fue, casi con seguridad, un intento de aparecer juntos en el ciclo de noticias.
El día del lanzamiento, Qwen 3.6 Max Preview alcanzó los mejores puntajes en seis benchmarks de codificación simultáneamente: SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench y SciCode. Es el tipo de barrida total que antes era imposible; también es el tipo de barrida total que pierde valor en el momento en que tres de los seis benchmarks provienen del propio laboratorio que lanza el modelo.
Esto es lo que probé: seguimiento de instrucciones en un flujo de trabajo agente multi-turno. Le di a Qwen 3.6 Max Preview una tarea de refactorización en 14 pasos, con restricciones específicas sobre convenciones de nombres, requisitos de cobertura de pruebas y una versión concreta de paquete Laravel que necesitaba que empleara. Once de los catorce pasos cumplieron todas las restricciones. Dos necesitaron aclaración. Uno malinterpretó la versión del paquete y tuvo que ser corregido. Eso está más o menos a la par de lo que obtengo con Opus 4.7 en este mismo tipo de tareas — y notablemente mejor que Qwen 3.6 Plus (lanzado el 30 de marzo de 2026).
La ventana de contexto de 260,000 tokens es menor que la de Kimi (aproximadamente 256K) o la del millón de Gemini, pero suficiente para la mayoría de trabajos en un único repositorio. Lo que hace interesante a Max Preview para los desarrolladores de agentes es la función preserve_thinking — diseñada específicamente para conservar los rastros de razonamiento a lo largo de flujos de trabajo multi-turno. Si estás construyendo agentes que necesitan retomar tareas tras una llamada a herramienta, esto importa más que la mera longitud del contexto.
La advertencia: Qwen 3.6 Max Preview no es de código abierto. Qwen ha sido, históricamente, open-weight, y la etiqueta "Preview" indica aquí que Alibaba sigue desarrollando el modelo, pero este giro hacia pesos cerrados es un cambio real, digno de seguimiento. Si apostabas por Qwen como el competidor open-weight frente a GPT, es hora de revisar esa suposición.
Compatible con API tanto de OpenAI como de Anthropic a través del endpoint compatible-mode de Alibaba Cloud. Esa es la superpotencia silenciosa: puedes integrarlo en pipelines existentes simplemente cambiando la URL base.
DeepSeek v4: El rumor supera la velocidad de entrenamiento
Ahora entramos de lleno en territorio de pura especulación, y quiero señalarlo claramente. Nada de lo que aparece en los próximos tres párrafos ha sido verificado de forma independiente. Son filtraciones, diagramas de arquitectura de procedencia dudosa y capturas de benchmarks que he visto circular en X por cuentas que pueden o no estar vinculadas a insiders de DeepSeek.
Lo que se filtró
La filtración dominante afirma que DeepSeek v4 es un modelo Mixture-of-Experts de entre 1 billón y 1,66 billones de parámetros, usando una arquitectura novedosa que combina kernels fusionados MQA dispersos, hiperconexiones y lo que la filtración denomina “MHC” (Contexto Multi-Jerárquico). Parámetros activos por token: aproximadamente 37 mil millones. Ventana de contexto: 1 millón de tokens.
Los benchmarks filtrados y más comentados: 83,7% en SWE-Bench Verified, 99,4% en AIME 2026, 88,4% en IMO Answer Bench, 23,5% en FrontierMath Tier 4. Si esto es cierto, posiciona a DeepSeek v4 por delante de GPT-5.2 y Claude Opus en todos los benchmarks listados.
Por qué aún no hago nada al respecto
A fecha del 21 de abril de 2026, DeepSeek v4 no se ha lanzado públicamente, ningún ID de modelo V4 aparece en la API de DeepSeek, y no hay ningún comunicado oficial. Los benchmarks son únicamente de pruebas internas—si es que son reales, son cifras de laboratorio bajo condiciones ideales, que históricamente retroceden un 5-15% cuando evaluadores independientes ejecutan las mismas pruebas. La cifra de “1,66T” proviene de una sola publicación en Medium. He leído esa publicación. La única evidencia es un diagrama de arquitectura filtrado que nadie ha conseguido rastrear hasta un ingeniero de DeepSeek. Podría ser real, o podría ser ficción hecha por fans con un buen filtro de Photoshop.
Lo que realmente planeo hacer: esperar al lanzamiento. Si DeepSeek v4 se publica esta semana—como sugieren algunas filtraciones—correré el mismo trabajo de auditoría en Laravel que realicé con Kimi K2.6 y publicaré los números reales. Hasta entonces, trata cualquier benchmark de DeepSeek v4 que veas como un rumor, no como un hecho. El requisito de más de 512 GB de RAM, que también circula, es plausible dadas las cifras de parámetros, pero deriva de las especificaciones filtradas, no ha sido confirmado de manera independiente.
Esto es lo que quiero que mejore en el ecosistema mediático de IA: distinguir entre lo filtrado y lo lanzado. Un modelo que podría aparecer esta semana y uno que demostradamente se lanza y corre en mi hardware, no son el mismo producto.
Grok 4.3 Beta: xAI Lanzó en Silencio la Función que Realmente Importa
xAI lanzó Grok 4.3 Beta el 17 de abril de 2026, exclusivo para suscriptores de SuperGrok Heavy a $300/mes. El recuento de parámetros: aproximadamente 0,5T en el checkpoint en vivo, con una versión de 1T a unos cinco días de completar el entrenamiento inicial cuando la beta se lanzó.
La mayoría de la cobertura se centró en el número de parámetros y el precio de $300 al mes. Ambas cosas cuentan una historia equivocada.
La historia correcta es que Grok 4.3 Beta es el primer modelo occidental importante que genera de forma nativa archivos PDF descargables, hojas de cálculo completamente pobladas y presentaciones de PowerPoint directamente desde la conversación. No es markdown que necesita conversión. No son fragmentos de código que renderizan un SVG. Archivos .xlsx auténticos, archivos .pdf auténticos, archivos .pptx auténticos. Este es el cambio de flujo de trabajo que todos los casos de uso agentivos estaban esperando, y de alguna manera se lanzó dentro del muro de pago de xAI sin que la mayoría de los medios lo recogieran.
Lo probé con una entrega para un cliente que estaba postergando: un análisis competitivo de 40 páginas en PDF con gráficos incrustados, formato personalizado y una hoja de cálculo ejecutiva a juego. Grok 4.3 Beta generó un primer borrador en 11 minutos. El PDF salió con formato limpio, notas al pie correctas y gráficos que no tuve que rehacer en Google Slides. La hoja de cálculo tenía fórmulas funcionales, pestañas bien organizadas y el formato condicional que requería.
No fue perfecto. Dos de los gráficos necesitaron ser reconstruidos porque los rangos de datos no coincidían con lo que había especificado, y el resumen ejecutivo contenía una estadística inventada que detecté al revisar los datos. Pero comparado con mi flujo de trabajo anterior —que implicaba generar markdown en Claude, convertir a Google Docs, rehacer manualmente los gráficos y exportar— esto redujo el tiempo en un 70% para una categoría de entregables que hago cada semana.
Otras capacidades: entendimiento multimodal nativo de video (puede procesar videos de propiedades, tomas de drones, reels de demostración), corte de entrenamiento en diciembre de 2025, menos alucinaciones en comparación con 4.20 Beta 2, y la misma ventana de contexto de 2 millones de tokens que debutó con 4.20 — sigue siendo la mayor entre los modelos cerrados occidentales.
La Hoja de Ruta de Grok (Marcada como Parcialmente Especulativa)
La hoja de ruta pública de xAI, de la que Musk ha hablado en escenario:
- Grok 4.4 — aproximadamente 1T de parámetros, principios de mayo de 2026
- Grok 4.5 — aproximadamente 1,5T de parámetros, finales de mayo de 2026
- Grok 5 — posicionada como AGI, sin fecha específica
Considero las fechas de 4.4 y 4.5 como "probables pero no garantizadas" dado el historial de xAI de retrasos en sus cronogramas anunciados. La afirmación de que "Grok 5 es AGI" es Musk siendo Musk — aún no ha definido públicamente qué significa AGI en su marco, y hasta que lo haga, la afirmación es marketing, no una especificación.
Google: El Jugador Silencioso Con la Semana Más Ruidosa en Puerta
Google I/O está aproximadamente a 28 días de distancia desde el 21 de abril de 2026, y Google ha estado lanzando actualizaciones incrementales de Gemini de una manera que parece una preparación previa al I/O. El modelo 3.1 Pro está activo y funcionando bien — 77.1% en ARC-AGI-2 según su propio anuncio, más del doble de la puntuación de razonamiento del anterior 3 Pro. Agent Mode para Gemini en Workspace ya está disponible para los planes Pro y Ultra. Gemini Canvas se lanzó dentro de Google Search para usuarios en EE. UU.
Lo que observaré en el I/O: si Google anuncia un nuevo checkpoint 3.2 Pro o 3.5 Pro, una variante Flash más ligera, y — la que realmente deseo — una capa expandida de codificación dentro de la suscripción de IA con límites de uso más altos. El plan actual de Google AI Pro restringe el uso de codificación de forma que resulta limitante para cualquiera que necesite trabajar seriamente con agentes en Gemini CLI o AI Studio.
He visto referencias en publicaciones de la comunidad sobre checkpoints “3.2 Pro” y “3.5 Pro” que supuestamente aparecen en los registros de Vertex AI, pero no pude confirmar esto de manera independiente en la documentación oficial al 21 de abril de 2026. Si existen, lo hacen como lanzamientos programados que aún no han sido anunciados oficialmente. La misma regla que con DeepSeek v4 — suspendo juicio hasta el anuncio.
Lo que sí está confirmado: el nuevo Gemini Agent para Workspace permite que el modelo trabaje en conjunto contigo dentro de Gmail, Sheets y Google Cloud. Esto es importante porque es la primera vez que un agente de IA obtiene acceso de escritura de primera mano en la superficie de correo electrónico que la mayoría de las empresas utilizan. Si habías pospuesto los flujos de trabajo con agentes porque tus datos están en Gmail y Workspace, la espera terminó.
El maratón de robots es la historia que realmente importa
Quizás hayas notado que he reservado el ángulo del maratón de robots para el final. Eso es deliberado.
El 19 de abril de 2026, un robot humanoide llamado "Lightning", construido por Honor, una empresa china de smartphones y no una firma dedicada a la robótica, completó la Media Maratón de Robots Humanoides de Yizhuang en Pekín en 50 minutos y 26 segundos. El récord mundial humano de Jacob Kiplimo en la carrera por carretera de Lisboa en marzo fue de unos 57 minutos. Un robot corrió 21 kilómetros más rápido que ningún ser humano en la historia.
El robot hizo una parada en boxes a mitad de carrera: cambio de batería, ráfaga de refrigerante industrial y aplicación de lubricante. Un comentarista lo describió como "Fórmula 1 con más angustia existencial para los atletas humanos". Lightning de Honor tiene piernas de 95 cm (aproximadamente 37 pulgadas), un sistema de refrigeración líquida y un diseño explícitamente inspirado en los corredores de fondo de élite. El robot ganador del año pasado tardó 2 horas y 40 minutos en completar el mismo circuito. El ganador de este año fue tres veces más rápido.
Incluyo el maratón de robots en este resumen de modelos de IA porque la historia importa al mismo nivel estructural que los lanzamientos de modelos. Kimi K2.6 y Qwen 3.6 Max Preview provienen ambos de laboratorios chinos. DeepSeek v4 —si finalmente se lanza— también viene de China. El robot Lightning de Honor es de China. En una ventana de cuatro semanas, los laboratorios de IA chinos han producido:
- El modelo de código abierto más competitivo frente a Claude Opus (Kimi K2.6)
- El modelo de código cerrado que arrasó en seis benchmarks de codificación agente en el día de su lanzamiento (Qwen 3.6 Max Preview)
- El mayor modelo MoE rumoreado, con las filtraciones de benchmarks más agresivas (DeepSeek v4)
- Un robot humanoide que batió el récord mundial humano en media maratón
Si todavía estás construyendo tu stack de IA asumiendo que solo tres laboratorios lanzan modelos de última generación, estás trabajando sobre un mapa que tiene unos seis meses de antigüedad.
Qué es lo que realmente estoy haciendo diferente esta semana
Bien, esa fue la investigación. Esto es lo que realmente cambió en mi flujo de trabajo como resultado.
Cambios que he realizado
He movido mi carga de trabajo de agentes de horizonte largo de Opus a Kimi K2.6 ejecutándose localmente. No todo — los trabajos creativos de escritura corta y el trabajo con alto contenido de razonamiento para clientes siguen en Opus 4.7. Pero los trabajos de auditoría nocturnos, el refactorizado por lotes, las canalizaciones de uso de herramientas que toman horas? Todo eso ahora va en K2.6. La reducción de costos de 10× es importante, pero todavía lo es más la historia de compliance con pesos locales para algunos de mis clientes.
Encendí Chronicle en una sola máquina de trabajo dedicada. No en mi portátil personal. No en ningún dispositivo con datos confidenciales de clientes que no haya autorizado explícitamente para procesamiento en la nube. La capacidad de obtener contexto directamente desde pantalla es realmente transformadora, y también representa una superficie de privacidad que todavía no estoy dispuesto a exponer en todo mi hardware.
Estoy esperando a DeepSeek v4. Tengo una suite de benchmarks lista para ejecutarse en cuanto esté disponible en la API. No estoy reconstruyendo ninguna canalización basado en benchmarks rumoreados. Si tú lo haces, detente.
Estoy evaluando Grok 4.3 Beta específicamente para entregables en PDF/hoja de cálculo — no para programación. Los $300/mes solo tienen sentido para mí si el flujo de trabajo para generación de documentos reemplaza mi procedimiento manual actual de exportación. Tras dos semanas, está cerca pero no completamente listo. Tomaré una decisión a fin de mes.
Qué haría si estuviera empezando desde cero hoy
Ejecuta K2.6 localmente en el hardware que tengas — incluso cuantizado, incluso en un solo M3 Ultra o un par de máquinas M4 Max. Suscríbete a ChatGPT Pro, específicamente por Codex con Chronicle. Mantén una suscripción a Claude Max para el trabajo pesado en razonamiento donde Opus sigue ganando. Evita el nivel SuperGrok Heavy salvo que la generación de documentos sea el núcleo de tu flujo de trabajo. No te comprometas con DeepSeek v4 hasta un mes después del lanzamiento, cuando las evaluaciones independientes se pongan al día.
Para quienes están construyendo agentes, la recomendación específica que he hecho a clientes esta semana es: si aún no has movido tus cargas de trabajo que no requieren razonamiento fuera de los modelos premium, esta es la semana para hacerlo. Explico la economía de fondo en detalle en mi guía de optimización de costos de agentes de IA, y el caso para ejecutar modelos open-weight locales en industrias reguladas aparece en mis notas sobre onboarding seguro de agentes de IA. Si sigues ejecutándolo todo a través de una API premium porque “no has tenido tiempo de evaluar alternativas", Kimi K2.6 es la excusa perfecta para por fin hacerlo.
Las limitaciones honestas de las que nadie habla
Cada modelo cubierto en este artículo implica compromisos. Aquí tienes la versión sin filtros.
Kimi K2.6 todavía queda detrás de Opus 4.7 en generación de código de una sola pasada con casos de prueba conocidos. Si tu flujo de trabajo es “escríbeme una función limpia a la vez”, Opus sigue siendo el ganador. K2.6 es la opción adecuada para cargas de trabajo agentivas, de largo plazo, intensivas en herramientas — no para todo.
GPT-5.5 "Spud" no está lanzado. Cada afirmación de capacidades que circula ahora mismo es especulación o filtración. No reconstruyas tu stack basándote en un modelo que ni siquiera existe en la API todavía.
DeepSeek v4 se adentra aún más en territorio de rumores que Spud. Considera cualquier cifra de benchmark que veas como rumor hasta que DeepSeek lo anuncie oficialmente.
Qwen 3.6 Max Preview es de pesos cerrados, lo que rompe el patrón histórico y es importante si valoras los ecosistemas abiertos. Tres de los seis benchmarks que arrasó pertenecen a Alibaba, lo que significa que el relato del “arrasó con todo” es menos sólido de lo que parece en el titular.
El precio de Grok 4.3 Beta de $300/mes solo tiene sentido para flujos de trabajo muy orientados a documentos. Para programación o investigación, hay opciones más económicas que lo superan.
Codex Chronicle procesa tu pantalla en la nube, sin cifrado de extremo a extremo. Eso supone una superficie real de exposición de seguridad. Trátalo como tal.
El modo Agente de Google Gemini es potente pero aún limitado a los niveles Pro y Ultra, y los límites de uso en las variantes de programación son lo bastante estrictos como para ser relevantes si haces trabajo serio de agentes.
Expongo esto de manera explícita porque he visto demasiados equipos en los últimos seis meses reorientar su stack completo basándose en un benchmark que no sobrevivió el uso en producción. Si tienes que recordar una sola cosa de este artículo: lo que está lanzado y probado siempre supera a lo filtrado y sobrepublicitado.
Lista de Seguimiento a 30 Días
Esto es lo que estoy observando para las próximas cuatro semanas, en un orden aproximado de impacto probable:
- Lanzamiento de GPT-5.5 "Spud" (esta semana o la próxima, según las probabilidades de Polymarket)
- Lanzamiento de DeepSeek v4 (se rumorea para esta semana; atento a un endpoint de API real)
- Grok 4.4 con aproximadamente 1T de parámetros (principios de mayo según la hoja de ruta de xAI)
- Google I/O (aproximadamente el 19 de mayo de 2026 según el patrón)
- Grok 4.5 con aproximadamente 1,5T de parámetros (finales de mayo según la hoja de ruta de xAI)
- Replicación independiente de los benchmarks de Kimi K2.6 (las pruebas de la comunidad deberían consolidarse en las próximas dos semanas)
- Qwen 3.6 Max Preview → lanzamiento final de Qwen 3.6 Max
La tendencia que vigilo: si los laboratorios chinos siguen superando a los occidentales en la cadencia de lanzamientos, si Spud se presenta como una super-app unificada o como una API independiente, y si DeepSeek v4 cumple al menos la mitad de sus benchmarks filtrados. Cualquiera de estos tres resultados redefine cómo deberías planificar los próximos seis meses.
Preguntas Frecuentes
¿Cuál es el mejor modelo de IA para usar en abril de 2026?
El mejor modelo de IA en abril de 2026 depende de tu carga de trabajo: Kimi K2.6 para tareas agenticas, de largo plazo y sensibles al costo; Claude Opus 4.7 para razonamiento y calidad de código single-shot; Gemini 3.1 Pro para trabajos multimodales y de largo contexto; Grok 4.3 Beta para generación de PDF y hojas de cálculo. No existe un único “mejor” — ajusta el modelo al trabajo.
¿Kimi K2.6 es realmente mejor que Claude Opus 4.7?
Kimi K2.6 es competitivo o superior a Opus 4.7 en razonamiento agentico con herramientas (54,0% vs 53,0% en HLE-Full), a un costo aproximadamente 10 veces menor. Opus 4.7 sigue liderando en generación de código single-shot con casos de prueba conocidos. Para cargas de trabajo agenticas de largo plazo, K2.6 es la mejor elección; para tareas de razonamiento intensivo en respuesta única, Opus 4.7 sigue ganando.
¿Cuándo se lanzará GPT-5.5 Spud?
Al 21 de abril de 2026, GPT-5.5 "Spud" no ha sido lanzado. Los traders de Polymarket estiman una probabilidad de lanzamiento de entre el 70-78% para el 30 de abril de 2026, siendo el 23 de abril la fecha específica más apostada. El preentrenamiento culminó alrededor del 24 de marzo de 2026, y actualmente el modelo está en fase de evaluación de seguridad por parte de OpenAI.
¿Son reales los benchmarks de DeepSeek v4?
Los benchmarks filtrados de DeepSeek v4 (83,7% SWE-Bench Verified, 99,4% AIME 2026) no han sido verificados de manera independiente. Al 21 de abril de 2026, DeepSeek v4 no ha sido lanzado públicamente, ningún modelo V4 aparece en la API de DeepSeek y la arquitectura declarada de 1,66T parámetros proviene de una única filtración de procedencia poco clara. Trátalo como rumor hasta su lanzamiento.
¿Vale la pena Grok 4.3 Beta por $300 al mes?
Grok 4.3 Beta a $300/mes vía SuperGrok Heavy vale la pena si tu flujo de trabajo implica generación intensiva de archivos PDF, hojas de cálculo o PowerPoint, ya que incluye generación nativa de archivos que otros modelos no ofrecen. Para programación, razonamiento o investigación, modelos más económicos (Claude, Gemini, Kimi) ofrecen un rendimiento comparable o superior por una fracción del precio.
Mirando hacia adelante
El panorama de modelos de IA en abril de 2026 es el siguiente: laboratorios chinos lanzando de manera agresiva, OpenAI consolidándose hacia una superapp unificada, xAI apostando por la generación de documentos como foso defensivo de flujo de trabajo, Anthropic defendiendo la prima del razonamiento, Google jugando a largo plazo rumbo a su I/O. Cualquiera de esas apuestas podría estar equivocada en seis meses. Pero el patrón que ya está sellado —el que la maratón robótica hizo imposible ignorar— es que ya no hay solo tres laboratorios lanzando IA de frontera. Hay al menos siete. Tal vez nueve si contamos los laboratorios de investigación que distribuyen silenciosamente a través de socios en la nube.
Si recuerdas el robot de la apertura: 50 minutos, 26 segundos. Cambio de batería a mitad de prueba. Tres veces más rápido que el ganador del año pasado. Ese es el ritmo al que avanzan también los lanzamientos de modelos. No estás rezagado si no has probado cada novedad: nadie lo ha hecho. Solo estarás atrás si sigues construyendo tu stack como si el ritmo más lento de 2024 aún se aplicara.
Prueba algo esta semana que aún no hayas probado. Kimi K2.6 es probablemente la opción de mayor apalancamiento para la mayoría de los que estáis leyendo esto. Ejecuta una carga de trabajo real. Comprueba si las cuentas del precio se ajustan a tu caso de uso concreto. Si es así, mueve esa carga de trabajo. Si no, también habrás aprendido algo, y habrás invertido un fin de semana en lugar de leer otro resumen.
La parada en boxes terminó. La carrera sigue. Nos vemos en la próxima vuelta.
Trabajemos juntos
¿Buscas desarrollar sistemas de IA, automatizar flujos de trabajo o escalar tu infraestructura tecnológica? Me encantaría ayudarte.
- Fiverr (desarrollos e integraciones personalizadas): fiverr.com/s/EgxYmWD
- Portafolio: mejba.me
- Ramlit Limited (soluciones empresariales): ramlit.com
- ColorPark (diseño y branding): colorpark.io
- xCyberSecurity (servicios de ciberseguridad): xcybersecurity.io