Skip to main content
OpenAI

Punto de inflexión de la IA en mayo de 2026: por qué apostaría ahora

SubQ rompió ventanas de contexto, GPT-5.5 redujo las alucinaciones en un 52 %, Anthropic envió a 10 agentes financieros: mi lectura honesta sobre lo que es

32 min
Tiempo de lectura
6,317
Palabras
Publicado
Engr Mejba Ahmed

Escrito por

Engr Mejba Ahmed

Compartir Artículo

Punto de inflexión de la IA en mayo de 2026: por qué apostaría ahora

Tenía el artículo a medio escribir cuando ocurrió el martes.

Se suponía que iba a ser un avance tranquilo. Las variantes de la prueba AB Gemini 3.x se filtran a través de la aplicación iOS. Algunos rumores sobre un modelo de vídeo Omni. Anticipación estándar previa a la keynote. Tomé mi café, mis notas, mi esquema. Y luego, el 5 de mayo de 2026 (el mismo martes), tres compañías dispararon tres armas cargadas en aproximadamente seis horas.

Una startup de Miami llamada Subquadratic salió del sigilo con una ventana de contexto de 12 millones de tokens y una afirmación de que su arquitectura utiliza menos del 5% del cómputo que Claude Opus quema. OpenAI cambió silenciosamente el cerebro predeterminado de ChatGPT por un nuevo modelo que alucina un 52,5% menos en cuestiones médicas, legales y financieras. Anthropic envió diez agentes financieros Claude listos para producción y una integración completa de Microsoft 365. Perplexity lanzó un agente financiero competidor el mismo día con 35 flujos de trabajo prediseñados y fuentes de datos en vivo de Morningstar, PitchBook, Daloopa y Carbon Arc.

Descarté el esquema.

Lo que está a punto de leer es cómo se ve mayo de 2026 catorce días antes de Google I/O, no como un resumen de un comunicado de prensa, sino como un informe de campo de alguien que ha estado implementando la producción AI para clientes reales que pagan mientras todo esto estaba aterrizando. Algunos de estos anuncios cambiarán la forma en que construyo los próximos doce meses. Algunas de ellas son ruido disfrazado de noticia. Y uno de ellos, sobre el que nadie gritaba en Twitter, es, en mi opinión, el momento AI más importante de 2026 hasta ahora. No es el que piensas.

Permítanme explicarles en qué estoy apostando, qué me estoy reteniendo y qué debería hacer cada desarrollador que lea esto esta semana antes de que I/O vuelva a barajar el mazo.

Por qué fue importante este martes en particular

He estado escribiendo sobre resúmenes semanales de AI durante dos años. La mayoría de las semanas se confunden. Un nuevo modelo. Un cambio de precios. Una caída de características. Aterrizan, obtienen un titular y tú sigues trabajando.

Este martes fue diferente de una manera que me tomó un día procesar por completo.

Lo que aterrizó el 5 de mayo no fueron tres lanzamientos de productos. Fueron tres apuestas arquitectónicas que convergieron en la misma semana, cuatro días después de la extinción de Google Project Mariner, su proyecto de investigación de agente de navegador de larga duración, e incorporó la tecnología al asistente personal del agente Gemini dentro de la aplicación Gemini. Ese atardecer no fue una nota a pie de página. Señaló que Google se está reposicionando por delante de I/O, lejos de los "agentes de navegador experimentales" y hacia "el agente 24/7 que vive donde usted vive". Dos semanas antes de la keynote.

Así que ahora aléjate. En una semana:

  • El piso de computación se movió. La arquitectura de atención dispersa subcuadrática de SubQ publicó números de referencia que, si se mantienen bajo una revisión independiente, colapsan la suposición de que la inteligencia de frontera requiere computación de frontera. - El modelo ChatGPT predeterminado se volvió más inteligente en las cosas que más importan. La reducción de alucinaciones del 52,5 % de GPT-5.5 Instant en dominios de alto riesgo es el tipo de nota de lanzamiento que OpenAI usó para guardar para lanzamientos de puntos completos. - La guerra de los servicios financieros AI se encendió. Anthropic y Perplexity abandonaron las suites de agentes de analistas financieros de la competencia el mismo día, ambos apuntando exactamente a los flujos de trabajo de analistas junior que han empleado ejércitos de MBA durante décadas. - Google despejó la pista. Proyecto Mariner descontinuado.

Modelo Omni filtrado en el Gemini UI. Conferencia magistral de I/O 2026 el 19 de mayo con una revelación de modelo esperada casi universalmente.

He reconstruido mi modelo mental del campo tres veces en catorce días. Si está ejecutando la producción AI en este momento, también debería hacerlo. Permítanme comenzar con el anuncio que creo que es más importante y que casi nadie trata como titular.

Subcuadrática y la pregunta de los 12 millones de tokens

El lanzamiento subcuadrático quedó enterrado bajo el ciclo de noticias GPT-5.5. Eso es un error.

Aquí está la versión corta. Una startup con sede en Miami llamada Subquadratic salió sigilosamente el 5 de mayo con 29 millones de dólares en financiación inicial, un modelo de frontera llamado SubQ y una ventana contextual de 12 millones de tokens construida sobre lo que llaman Subquadratic Sparse Attention (SSA). Según su blog técnico, SSA logra una aceleración de precarga de 7,2 veces sobre la atención densa con 128.000 tokens, aumentando a 52,2 veces con 1 millón de tokens, y en el contexto completo de 12 millones de tokens, el modelo utiliza menos del 5 % de la computación de sistemas fronterizos comparables, lo que describen como una reducción de casi 1000 veces.

Lea esos números lentamente. Luego vuelva a leerlos.

La suposición dominante desde GPT-3 ha sido que la escala cuesta computación y la computación cuesta dinero y el dinero genera inteligencia. Cada lanzamiento de modelo fronterizo de los últimos tres años ha reforzado ese muro. Opus 4.6 es excelente y caro. Gemini 3 Pro es excelente y caro. GPT-5 es excelente y caro. Todos los niveles de precios sobre los que hemos estado discutiendo tienen como alcance ese piso de computación.

Si los reclamos de la SSA sobreviven a la verificación de terceros, ese piso se movió.

Los puntos de referencia que publicaron no son modestos. En RULER a 128K, SubQ obtiene una puntuación de 97,1 frente al 94,8 de Opus 4.6. En SWE-Bench Verified, SubQ reporta 82,4% frente al 81,4% de Opus 4.6 y el 80,6% de Gemini 3.1 Pro. En evaluaciones de contexto largo específicamente, los tipos de tareas en las que la mayoría de los modelos se desmoronan más allá de los 200.000 tokens, SubQ aparentemente se mantiene unido a 12 millones.

Quiero tener cuidado. La lectura honesta es más cautelosa que el titular.

El campo del escepticismo no está equivocado. Subquadratic aún no tiene un documento técnico público que detalle la arquitectura con suficiente profundidad para reproducirla. Las cifras de referencia son autoinformadas. Las afirmaciones de complejidad no han sido verificadas de forma independiente. Todos hemos visto este patrón antes: un laboratorio publica números mágicos, la comunidad ejecuta la suite de evaluación, la magia se reduce.

Entonces, ¿por qué encabezo el artículo con esto en lugar de GPT-5.5 o los agentes financieros? Porque la dirección de la apuesta importa más que la precisión exacta de los números de lanzamiento.

Los observadores del sector financiero no son los únicos que deberían prestar atención a esto. Si la atención subcuadrática funciona a escala de frontera (incluso con la mitad de la eficiencia que afirman), cambia lo que es posible poner en una ventana de contexto para aplicaciones normales. Un contexto de 12M no es un contexto de 1M un poco más grande. Es la base de código completa de un producto SaaS de tamaño mediano, en un solo mensaje, con costos de computación que se parecen más a un modelo Flash actual que a un modelo Opus actual. Esa es una categoría diferente de herramienta.

Esta semana estoy realizando mi primera prueba de producción de SubQ. No me comprometeré a nada hasta que tenga mis propios números con mis propios datos. Pero tampoco apuesto contra la innovación arquitectónica que genera resultados tan agresivos en un conjunto de referencia tan competitivo. Me he equivocado en esa apuesta muchas veces antes.

Si está implementando la producción AI en mayo de 2026, este es el paso práctico: no migre todavía, pero diseñe un mundo donde los precios de la ventana de contexto colapsan. Deje de optimizar para estrategias de fragmentación de 200.000 tokens que suponen que el límite se mantendrá. Cree canales de recuperación que puedan ampliarse elásticamente si en los próximos doce meses se convierte el nivel de contexto 1M en el nuevo nivel Flash. (Para obtener un manual práctico sobre la gestión de sesiones de 1 millón de tokens hoy, consulte mis notas de gestión de contexto Claude Code 1M: la misma escala de patrones). Las decisiones sobre herramientas que tome ahora se verán muy diferentes si la apuesta SSA da sus frutos.

GPT-5.5 Interruptor predeterminado instantáneo y silencioso

Mientras SubQ estaba involucrando al investigador Twitter en una pelea, OpenAI estaba haciendo un tipo diferente de movimiento: uno más silencioso y con más forma empresarial.

El 5 de mayo, OpenAI lanzó GPT-5.5 Instant como el nuevo modelo predeterminado para ChatGPT, reemplazando el GPT-5.3 Instant que había sido predeterminado desde principios de este año. Los números de los titulares en la publicación de lanzamiento de la compañía:

  • 52,5% menos de alucinaciones ante indicaciones médicas, legales y financieras de alto riesgo en evaluaciones internas
  • 37,3% menos de afirmaciones inexactas en un conjunto separado de mensajes que los usuarios habían marcado previamente por errores fácticos
  • Puntuación de HealthBench de 51,4 sobre 100, frente a 49,6 (GPT-5.3 Instant)
  • HealthBench Professional (clínico) con 38,4, frente a 32,9
  • AIME 2025 a 81,2, frente a 65,4 para GPT-5.3
  • MMMU-Pro a 76,0, frente a 69,2

Si pasa por alto esos números, se perderá la historia real.

La historia no es que el modelo haya mejorado. Los modelos mejoran. La historia es en qué ejes mejoró. OpenAI optimizado GPT-5.5 Instantáneo explícitamente para las cosas que importan legal y financieramente: médica, legal, financiera. El modelo que millones de personas utilizarán de forma predeterminada cuando abran ChatGPT ahora es significativamente más confiable en las preguntas en las que equivocarse tiene consecuencias reales.

Se trata de una elección estratégica, no de un accidente técnico. Y sigue el patrón más amplio del 5 de mayo. Tanto OpenAI como Anthropic, exactamente el mismo martes, apuntaron sus lanzamientos de mayor apalancamiento a dominios profesionales de alto riesgo.

Esto es lo que eso significa en la práctica para mí.

He estado probando GPT-5.5 Instant en los tipos de tareas que normalmente envío a Opus por razones de seguridad: revisión de contratos legales para el trabajo de clientes, análisis financiero para auditorías de precios de SaaS, investigación médica básica adyacente en la que intento explícitamente evitar que el modelo invente algo. La señal temprana es real. No es una calidad de Opus en modo de investigación. Pero para respuestas rápidas y de nivel predeterminado en esos dominios, la caída en la tasa de alucinaciones es notable de una manera que GPT-5.3 no lo era.

Los usuarios pagos mantienen el acceso a GPT-5.3 Instant durante los próximos tres meses en caso de que el nuevo valor predeterminado se comporte de manera diferente para sus flujos de trabajo específicos. Ese detalle importa. OpenAI indica que esperan que algunos usuarios sientan el cambio como una regresión, probablemente porque GPT-5.5 Instant cambia ciertos comportamientos estilísticos por ganancias de precisión. Si tiene un scaffolding rápido ajustado a las peculiaridades de GPT-5.3, auditelo antes de que se cierre la ventana de tres meses.

La implicación poco discutida: OpenAI admite silenciosamente que el modelo predeterminado importa más que el modelo insignia. La mayoría de los usuarios de ChatGPT nunca optarán por el nivel más caro. El modelo que obtiene respuestas a la mayoría de las preguntas AI del mundo es el predeterminado. Optimizarlo para lograr una precisión de alto riesgo es una palanca de impacto social mucho mayor que otra décima por ciento en AIME.

Mantengo mi suscripción a Opus debido al razonamiento de contexto prolongado y las integraciones de agentes que he creado en torno a Claude Code. Pero para una parte significativa de mis preguntas únicas, especialmente aquellas en las que antes habría verificado dos veces la respuesta en una segunda herramienta, GPT-5.5 Instant es ahora la primera llamada que hago. Eso no ha sido cierto desde GPT-4.

La caída del agente financiero Anthropic y por qué Microsoft 365 es la verdadera historia

El anuncio de Anthropic del 5 de mayo fue el más denso de la semana, y la parte que obtuvo la mayor cobertura (las diez plantillas de agentes financieros) no fue la parte más importante.

Permítanme cubrir las plantillas primero, porque son reales. Anthropic lanzó diez plantillas de agentes listas para ejecutar para servicios financieros, divididas en dos categorías:

Investigación y cobertura de clientes (5 agentes):

  • Constructor de tono
  • Preparador de reuniones
  • Revisor de ganancias
  • Constructor de modelos
  • Investigador de mercado

Finanzas y Operaciones (5 agentes):

  • Revisor de valoración
  • Conciliador del libro mayor
  • Cierre de fin de mes
  • Auditor de declaraciones
  • Analizador KYC (Conozca a su cliente)

Cada agente es lo que Anthropic llama una "arquitectura de referencia": una combinación empaquetada de habilidades (instrucciones y conocimiento del dominio para la tarea), conectores (acceso gobernado a los datos en los que se ejecuta la tarea) y subagentes (modelos Claude adicionales para subtareas). Pueden ejecutarse como complementos dentro de Claude Cowork y Claude Code junto con analistas humanos, o pueden implementarse como agentes administrados por Anthropic donde Anthropic maneja la infraestructura de producción.

Ese es el tipo de comunicado que merece un párrafo serio por parte de cualquiera que cubra AI financiero. Pero esto es lo que quedó enterrado.

Mismo anuncio. El mismo día. Anthropic se envió integración completa con Microsoft 365: Claude funciona como un único agente en Excel, PowerPoint, Word y Outlook, llevando contexto a las cuatro aplicaciones simultáneamente.

Si no trabaja en finanzas, es posible que esa frase no se registre. Si lo haces, debería caer como un piano que cae.

El flujo de trabajo estándar de un analista junior se ve así: extraer datos en Excel, modelarlos, crear una presentación en PowerPoint, redactar la nota de portada en Word, enviarla a través de Outlook con tres correos electrónicos de seguimiento. Cada ruptura de herramienta solía significar una ruptura de contexto: un lugar donde la información tenía que transportarse manualmente entre aplicaciones, donde los errores aparecían, donde los analistas junior pasaban las horas poco glamorosas que justificaban sus salarios de nivel inicial.

Un único agente que mantiene el contexto en las cuatro aplicaciones de Microsoft 365 no es una "herramienta de productividad AI". Es la desaparición estructural de una categoría laboral de nivel inicial. Combinado con la asociación de datos de Moody's Anthropic anunciada el mismo día, el mensaje es inequívoco: Anthropic no está creando compañeros de chat para analistas. Están construyendo la fuerza laboral digital que solían ser los analistas.

Para el paralelo de la estrategia, mis notas de campo sobre la implementación del agente administrado de Anthropic cubren el modelo de "infraestructura de producción segura" con más profundidad; esa es la misma tubería que ahora impulsa estas plantillas financieras.

Aquí es también donde entra la historia de Perplejidad.

El contragolpe de la perplejidad y quién gana realmente

Exactamente el mismo martes, Perplexity lanzó Computer for Professional Finance.

La similitud estructural no es sutil:

  • 35 flujos de trabajo financieros dedicados que automatizan el trabajo que los analistas repiten cada semana
  • Integraciones de datos con licencia con Morningstar, PitchBook, Daloopa y Carbon Arc
  • Una integración del servidor PitchBook Essential MCP que brinda a Perplexity acceso nativo a la inteligencia firmográfica de PitchBook.
  • Formatos de salida que incluyen hojas desmontadas, gráficos de acciones anotados y comparaciones de investigaciones de acciones con cada cifra vinculada a su fuente.

Si el discurso de Anthropic es "una fuerza laboral de AI que opera dentro de su pila existente de Microsoft 365", el discurso de Perplexity es "el sistema operativo financiero en sí": una herramienta de destino, no una integración. Mientras que Anthropic pide a las empresas que conecten Claude a su cadena de herramientas existente, Perplexity les pide que migren a una nueva superficie de trabajo donde los datos residen de forma nativa.

Ambas apuestas pueden ganar. Probablemente no ambos ganen en las mismas cuentas.

Mi lectura honesta: Anthropic tiene la ventaja en este momento, por una razón que no tiene nada que ver con la calidad del modelo. La integración de Microsoft 365 es el foso. La mayoría de las grandes empresas de servicios financieros ejecutan su trabajo en Excel y PowerPoint. Pedirles que migren los flujos de trabajo de los analistas a una nueva herramienta de destino es una fricción. Pedirles que agreguen Claude como una capa sobre las herramientas que ya usan es casi gratis. Esta es una ventaja estructural que no depende de qué modelo escriba un resumen de ganancias ligeramente mejor.

Pero Perplexity tiene algo que Anthropic no tiene: asociaciones de datos nativas integradas en la propia superficie del producto. La integración de PitchBook MCP en particular es una forma diferente de ventaja. Cuando la pregunta es "encuéntreme todos los acuerdos de SaaS Serie B en los últimos 18 meses que cerraron a más de 12x ARR", el modelo que ya tiene datos de PitchBook conectados tiene una ventaja estructural sobre el modelo al que se le debe decir dónde buscar.

El pronóstico honesto es que esto será una división flujo de trabajo por flujo de trabajo. La evaluación KYC y el cierre de fin de mes van a Anthropic debido a la integración operativa. La investigación de mercado y la búsqueda de acuerdos van a Perplexity debido a la capa de datos. La elaboración del libro de propuestas y la revisión de las ganancias serán objeto de disputas durante los próximos dieciocho meses.

Si está implementando AI en un contexto de servicios financieros este trimestre, no elija uno. Ejecute ambos, con el ámbito de flujos de trabajo específicos. La presión competitiva entre ambos aumentará los precios y la capacidad más rápido de lo que cualquiera de ellos lo habría hecho solo.

Gemini 3.2 Flash, pruebas AB y codificación anterior a I/O

Pasemos ahora a la parte que originalmente había planeado liderar, y que ha sido degradada por todo lo anterior.

Google ha estado AB probando múltiples variantes de Gemini 3.x durante semanas antes de I/O.. Los nombres detectados en los registros de tráfico de la aplicación iOS Gemini incluyen Gemini 3.2 Flash, Ajax, Hercules, Hector y Orpheus. Las variantes parecen estar cíclicamente: un usuario de Reddit informó que su aplicación iOS Gemini cambió de Gemini 3 Flash a 3.1 a 3.2 en un período de 24 horas.

El precio filtrado para Gemini 3.2 Flash, basado en los registros AI Studio API, es de 0,25 dólares por 1 millón de tokens de entrada y 2 dólares por 1 millón de tokens de salida. Si esos números se mantienen en el lanzamiento de I/O, Gemini 3.2 Flash alcanza precios de nivel flash con capacidad cercana a Gemini 3.1 Pro, lo que ampliaría la ventaja de precio versus calidad de Google en el nivel medio.

Una corrección importante que vale la pena señalar, ya que la he visto en los resúmenes de esta semana. El límite de conocimiento para los modelos Gemini 3 es enero de 2025, no enero de 2026. Vi el número de 2026 citado en algunos hilos de resumen. No es lo que dice la documentación del modelo de Google. Vale la pena hacerlo bien antes de diseñar la lógica de recuperación en torno a una suposición que no coincide.

La historia más importante de Google es la fuga del modelo Omni. Una cadena UI detectada en la interfaz de generación de video Gemini esta semana muestra la línea "Comience con una idea o pruebe una plantilla. Desarrollado por Omni" junto a "Toucan", el nombre interno de la ruta de video existente impulsada por Veo-3.1. La ubicación de "Omni" dentro del consumidor UI, no sólo en los registros de código, es lo que hace que los observadores piensen que esto es más grande que un cambio de nombre.

Hay tres interpretaciones plausibles:

  1. Omni es un nombre público para la misma vía Veo. Posible pero aburrido.
  2. Omni es un nuevo modelo de video entrenado con Gemini junto con Veo. Posible.
  3. Omni es un omnimodelo unificado Gemini que maneja imágenes y videos de forma nativa en un solo sistema. La posibilidad más significativa desde el punto de vista arquitectónico, y la que aterrizaría con más fuerza en I/O.

Si se cumple la interpretación tres, Google envía el primer omnimodelo de primer nivel que maneja vídeo e imágenes en un único sistema unificado. Combinado con el final del Proyecto Mariner el 4 de mayo y su incorporación al asistente personal del Agente Gemini, la narrativa de I/O se está organizando cuidadosamente: una revelación de modelo insignia, un sistema de generación multimodal unificado y un agente 24/7 que vive dentro de la aplicación Gemini y reemplaza el trabajo experimental de navegador-agente que Mariner estaba haciendo.

Tres presentaciones de modelos plausibles en I/O 2026 (del lunes 19 de mayo al martes 20 de mayo):

  • Gemini 3.5 Pro / 3.5 Flash: forma más probable del lanzamiento del titular
  • Gemini 4.0 — Los comerciantes de Polymarket están en un 94,5% con un "no" para el lanzamiento de 4.0 antes del 30 de junio, pero I/O ha sorprendido antes
  • Omni como buque insignia de la generación multimodal combinado con el nuevo titular Gemini

Lo que estoy observando específicamente: precios en el nuevo nivel Flash, si el agente dentro de la aplicación Gemini obtiene un nombre y modelo de precios separados de la experiencia de chat, y si Google anuncia algo que aborde la brecha de codificación agente con Codex y Claude Code, porque ahí es donde ha estado Google. perdiendo terreno más rápidamente.

Para el contexto más amplio de la carrera, cubrí la carrera de superagente AI en mayo de 2026 la semana pasada: la prueba lado a lado de Codex, Cowork y Gemini que terminó con solo uno terminando limpiamente mi tarea matutina. Spoiler: no era Gemini. I/O es la oportunidad de Google de cambiar eso.

Gemma 4 MTP Drafters: la versión más útil de la que nadie habló

Mientras SubQ se comía los titulares, el equipo de código abierto de Google envió algo que a casi todos los desarrolladores que lean esto debería importarles más que en la actualidad.

Primero una aclaración rápida, porque esto se confundió en las notas fuente con las que estaba trabajando. El lanzamiento del borrador de predicción de múltiples tokens fue para Gemma 4, la familia de modelos de código abierto de Google, no para Gemini 4. Dos productos diferentes, dos vías de lanzamiento diferentes. Gemma 4 es el que realmente puedes ejecutar.

Esto es lo que se envió. Redactores de MTP (predicción multitoken) para la familia Gemma 4 utilizando una arquitectura de decodificación especulativa especializada. El redactor se empareja con un modelo de destino pesado (por ejemplo, Gemma 4 31B) y utiliza computación inactiva para predecir varios tokens futuros a la vez con el redactor liviano, en menos tiempo del que tarda el modelo de destino en procesar un token. Luego, el modelo de destino verifica todos los borradores de tokens en paralelo.

El resultado: aceleración hasta 3 veces sin degradación de la calidad de salida.

Los redactores de MTP se lanzan bajo la misma licencia de Apache 2.0 que Gemma 4, con pesos de modelo disponibles en Hugging Face y Kaggle, y soporte para Transformers, MLX, vLLM, SGLang y Ollama listos para usar.

Para los desarrolladores que ejecutan modelos Gemma 4 locales en GPU de consumo o Apple Silicon, esta es una importante mejora de latencia gratuita. Si tiene una aplicación de chat en tiempo real, un flujo de trabajo de agencia o un producto de voz donde la latencia percibida por el usuario es importante, los redactores de MTP son una integración de una sola noche que reduce notablemente los tiempos de respuesta sin cambiar el modelo en sí.

Este es el tipo de lanzamiento que no genera ciclos de discurso sino que mejora silenciosamente la experiencia de producción de todos los que ejecutan modelos abiertos. Vale la pena evaluar diez minutos de tu semana.

El catálogo de Pomelli y la herramienta de marketing AI se están alimentando silenciosamente de los flujos de trabajo de las PYMES

Un lanzamiento más de Google que se ajusta al patrón de "barco silencioso, impacto real".

Pomelli: Google Labs y la herramienta de marketing AI de DeepMind para pequeñas y medianas empresas: agregaron una función llamada Pomelli Catalog. El flujo es: usted carga sus productos o servicios, Pomelli los almacena en su catálogo y la herramienta genera campañas de marketing personalizadas y fotografías de productos creadas por AI a pedido. Gratis, disponible en todo el mundo donde se lanza Pomelli (EE. UU., Canadá, Australia, Nueva Zelanda y Europa en expansión).

Pomelli trabaja analizando su sitio web para crear un perfil de ADN empresarial (su tono de voz, fuentes personalizadas, imágenes, paleta de colores) y luego genera campañas que coincidan. Con la incorporación del catálogo, el ciclo se cierra: entran los productos, sale la creatividad de la campaña de marca, descargable para Instagram, TikTok, Facebook, YouTube y LinkedIn.

La incorporación en enero de 2026 de Pomelli Animate, con tecnología de Veo 3.1, permite que la herramienta transforme contenido de marketing estático en animaciones de vídeo de marca. Combinado con la función Sesión de fotos de Catalog, que utiliza Nano Banana 2 para convertir cualquier fotografía de producto en imágenes profesionales con calidad de estudio, tienes un flujo de trabajo de marketing completo para PYMES (foto de marca, video de marca, campaña de marca) en una sola herramienta gratuita.

Para los operadores individuales y las PYMES que ejecutan comercio electrónico, esta es la versión de la historia de automatización de marketing AI de la que sigo contándoles a mis amigos y ellos siguen subestimando. No es tan llamativo como una armada de agentes financieros. Es más útil para más personas. Si tienes una tienda Shopify con menos de cincuenta SKU, deberías haber probado el catálogo Pomelli antes del viernes.

La barra lateral de Boston Dynamics que vale la pena archivar

Una nota que no encaja en la historia del software AI pero que pertenece a la imagen de mayo de 2026.

El robot humanoide Atlas de Boston Dynamics entrará en producción. En CES 2026 en enero, la compañía presentó la versión lista para producción. En mayo de 2026, todas las implementaciones de Atlas para 2026 están totalmente comprometidas. Está previsto que las flotas se envíen al Centro de aplicaciones Robotics Metaplant de Hyundai y, significativamente, a Google DeepMind, que está integrando sus modelos básicos Gemini Robotics AI en el sistema Boston Dynamics.

El detalle relevante no son los videos de baile. Es la asociación con DeepMind. La misma empresa que envía variantes Gemini 3.x y un modelo multimodal Omni es la que coloca la frontera AI dentro de robots humanoides. La convergencia de modelos de lenguaje, generación multimodal y AI incorporado se producirá en mayo de 2026, en la hoja de ruta de Google, con el chasis de Boston Dynamics. Archive esto para la conversación posterior a I/O. Leeremos mucho más sobre Gemini Robotics en la segunda mitad de 2026.

En qué apostaría realmente si estuviera implementando la producción AI este mes

Ocho mil palabras, aquí está la destilación del informe de campo. Si está implementando flujos de trabajo de producción AI en mayo de 2026, esto es lo que realmente haría esta semana.

Arquitecto para un colapso de la ventana de contexto. No migre a SubQ todavía (espere la verificación independiente), pero deje de crear estrategias de fragmentación que supongan que 200K es el límite. Es probable que los próximos doce meses conviertan el contexto de 1 millón en algo en juego y 10 millones o más en una posibilidad real. Cree canales de recuperación que escalen elásticamente.

Utilice GPT-5.5 Instant como nuevo valor predeterminado para preguntas factuales únicas en dominios de alto riesgo. Mantenga su suscripción a Opus para razonamiento de contexto prolongado y trabajo como agente. Pero para consultas médicas, legales o financieras rápidas, GPT-5.5 Instant es ahora la primera llamada que hago.

Ejecute ambos agentes financieros Anthropic Claude y Perplexity Computer en paralelo, con alcance para diferentes flujos de trabajo. Anthropic para todo lo que se encuentra dentro de Microsoft 365. Perplexity para cualquier cosa que necesite datos de PitchBook, Morningstar, Daloopa o Carbon Arc de forma nativa. No elijas uno hasta que la pelea haya durado noventa días.

Espere hasta I/O antes de comprometerse con una integración Gemini. El precio flash de Gemini 3.2 es extremadamente competitivo en el papel, pero lanzar el trabajo de producción en un modelo dos semanas antes de que anuncie su sucesor es una receta para una migración que no planeó. Mire la conferencia magistral del 19 de mayo y luego comprométase.

Integre los redactores MTP de Gemma 4 en cualquier flujo de trabajo de modelo local que esté ejecutando. Es una ganancia de latencia gratuita.

Si dirige una PYME o una empresa de comercio electrónico con menos de cincuenta SKU, pruebe el Catálogo Pomelli esta semana. Es la versión de la historia de automatización de marketing AI que consistentemente sobrepasa su publicidad en relación con su publicidad.

Esté atento a la respuesta de codificación agente de Google en I/O. Esa es la brecha que Google necesita cerrar y la que afectará más directamente a todos los desarrolladores que lean esto. Si envían algo que compite con Claude Code o Codex en el tipo de flujos de trabajo de codificación agente de larga duración que cubrimos en el desglose de la carrera de súper agentes de mayo, su conjunto de herramientas cambia.

Lo único que casi me pierdo

He estado escribiendo resúmenes de AI el tiempo suficiente para saber que los anuncios que parecen más importantes en la primera semana a menudo no son los que importan en el sexto mes. Mirando retrospectivamente los anuncios que escribí sin aliento hace aproximadamente un año, ahora la mitad de ellos son notas a pie de página. La misma precaución se aplicó a la reestructuración de la industria de abril de 2026: la mitad de esas historias de pánico se normalizaron en treinta días y la señal duradera quedó enterrada en las publicaciones más silenciosas.

Así que me he obligado a preguntar, todos los martes como este: ¿de cuál de estos seguiré hablando en noviembre?

GPT-5.5 Instant es un lanzamiento silencioso y duradero. La caída de las alucinaciones en los dominios de alto riesgo es el tipo de mejora que importa cada semana, para siempre, para miles de millones de usuarios. Eso es duradero.

La lucha de los agentes financieros es duradera. Ya sea Anthropic o Perplexity los que ganan más flujos de trabajo, la desaparición de los puntos de entrada de los analistas junior está ahora en marcha. En 2027 estaremos hablando de cómo esto cambió la contratación de servicios financieros.

Los redactores Gemma 4 MTP son duraderos de una manera aburrida y útil. Una inferencia local más rápida no es glamorosa, pero supone una mejora real para cualquiera que ejecute modelos abiertos localmente. Eso se queda en mi pila.

Las variantes de la prueba Gemini 3.2 Flash AB (Ajax, Hercules, Hector, Orpheus) no son duraderas. Son ruidos previos al lanzamiento. Para junio, todo esto será reemplazado por lo que Google realmente anuncie en I/O.. Si hoy dedica ciclos mentales a las variantes, redirija esos ciclos a la conferencia magistral de I/O el 19 de mayo.

Y SubQ. SubQ es el comodín. Si las afirmaciones arquitectónicas sobreviven, será el lanzamiento más significativo de 2026, más grande que cualquier cosa que espero que Google anuncie en I/O.. Si no sobreviven, se unirá al largo cementerio de "números mágicos en puestos de lanzamiento que no se reprodujeron". Estoy atento a que los subprocesos de replicación de pruebas comparativas de terceros comiencen a llegar en las próximas dos semanas. Si se alinean con las afirmaciones de la empresa, en otoño estaremos en un nuevo régimen informático. Si no lo hacen, seguimos construyendo sobre el piso que tenemos.

I/O es en dos semanas. El panorama actual, el 6 de mayo de 2026, será diferente el 21 de mayo. Pero la dirección de las apuestas (hacia modelos de mayor contexto y menor costo, precisión de dominio profesional, automatización de servicios financieros y asociaciones AI incorporadas) no va a revertirse. Los próximos doce meses estarán definidos por cuáles de esas apuestas se cobrarán y con qué rapidez.

El artículo que me senté a escribir habría sido un tranquilo adelanto de Google I/O 2026. Ya no es eso. Es una instantánea del momento en que el campo realmente cambió bajo los pies de todos, y una teoría práctica sobre qué paso tomar primero.

Si solo hace una cosa después de cerrar esta pestaña: mire la conferencia magistral de I/O el 19 de mayo con el marco anterior en su cabeza. Busque qué brechas cierra Google, cuáles despejan y qué anuncios hacen que nadie vio venir. La brecha entre lo que envían y lo que envió el resto de esta semana le dirá exactamente hacia dónde se dirigen los próximos doce meses.

Estaré observando en vivo la conferencia magistral. Nos vemos al otro lado.

Preguntas frecuentes

¿Qué es la atención dispersa subcuadrática y por qué es importante?

Subquadratic Sparse Attention (SSA) es la arquitectura detrás de SubQ, el modelo de frontera de la startup con sede en Miami lanzado el 5 de mayo de 2026. Calcula selectivamente la atención solo sobre las posiciones de los tokens que importan, en lugar de comparar cada token con todos los demás. La compañía afirma tener una ventana de contexto de 12 millones de tokens a menos del 5% del costo informático de Claude Opus. Si se verifica de forma independiente, colapsa la suposición de que la inteligencia de frontera requiere computación de frontera.

¿Cuándo se lanzó GPT-5.5 Instant y qué cambió?

OpenAI lanzó GPT-5.5 Instant como el nuevo modelo predeterminado de ChatGPT el 5 de mayo de 2026. El cambio principal es una reducción del 52,5% en las alucinaciones en indicaciones médicas, legales y financieras en comparación con GPT-5.3 Instant, con puntuaciones de HealthBench que aumentaron de 49,6 a 51,4 y AIME 2025 de 65,4 a 81,2. Los usuarios pagos conservan el acceso instantáneo GPT-5.3 durante tres meses.

¿Cuáles son las 10 plantillas de agentes financieros de Anthropic?

Anthropic lanzó 10 agentes financieros Claude listos para usar el 5 de mayo de 2026, divididos en dos categorías: Investigación/Client Cobertura (creador de propuestas, preparador de reuniones, revisor de ganancias, creador de modelos, investigador de mercado) y Finance/Operations (revisor de valoraciones, conciliador de contabilidad general, cierre de fin de mes, auditor de estados de cuenta, KYC evaluador). Se ejecutan dentro de Claude Cowork y Claude Code o como agentes administrados por Anthropic, con integración completa de Microsoft 365.

¿Cuándo es Google I/O 2026 y qué se espera?

Google I/O 2026 se llevará a cabo del 19 al 20 de mayo de 2026, con el discurso de apertura el 19 de mayo. Los anuncios esperados incluyen una importante revelación del modelo Gemini (probablemente Gemini 3.5, posiblemente Gemini 4.0), el rumoreado modelo de generación multimodal Omni y actualizaciones de agentes. tras la puesta de sol del Proyecto Mariner el 4 de mayo y las probables actualizaciones de Veo y Nano Banana. Lo más importante a tener en cuenta es si Google cierra la brecha de codificación agente con Codex y Claude Code.

¿Cuál es la diferencia entre Gemini 4 y Gemma 4?

Son líneas de productos separadas. Gemini es la familia de modelos insignia de código cerrado de Google. Gemma es la familia de modelos de código abierto de Google. La versión del redactor de predicciones de tokens múltiples de mayo de 2026 que proporcionó aceleraciones de inferencia 3x fue para Gemma 4 (código abierto, disponible en Hugging Face y Kaggle bajo Apache 2.0), no para Gemini 4. Los dos a menudo se confunden pero se envían por caminos diferentes.

Trabajemos juntos

¿Quiere crear sistemas AI, automatizar flujos de trabajo o ampliar su infraestructura tecnológica? Me encantaría ayudar.

Publicidad
Coffee cup

¿Te gustó este artículo?

Tu apoyo me ayuda a crear más contenido técnico detallado, herramientas de código abierto y recursos gratuitos para la comunidad de desarrolladores.

Temas Relacionados

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Artículos Relacionados

Ver Todos

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support