Skip to main content
📝 Claude Code

Code with Claude 2026: el futuro de los agentes ya es real

Sueños, bucles de resultados, orquestación de múltiples agentes, contexto infinito, Mythos: lo que la conferencia Code with Claude de Anthropic realmente

31 min

Tiempo de lectura

6,127

Palabras

May 06, 2026

Publicado

Engr Mejba Ahmed

Escrito por

Engr Mejba Ahmed

Compartir Artículo

Code with Claude 2026: el futuro de los agentes ya es real

Code with Claude 2026: el futuro de los agentes ya es real

Casi no vi la keynote en vivo.

Era el miércoles 6 de mayo por la mañana, mi cartera de agentes ya estaba funcionando y tenía que entregar un cliente para el almuerzo. La transmisión en vivo de Code with Claude estaba en una pestaña al lado de mi terminal, silenciada, mientras limpiaba un flujo de trabajo de contenido de múltiples agentes. Entonces vi la diapositiva.

Una sola palabra, blanca sobre un fondo oscuro, en el tipo de tipografía que sólo aparece para algo que has estado reteniendo. Soñando.

Desactivé la transmisión y vi a la directora de productos de Anthropic, Ami Vora, describir lo que era, en papel, una función de memoria. Cuando llegó a la parte en la que los agentes revisan sus propias sesiones pasadas para encontrar patrones, identificar errores recurrentes y conservar conocimientos útiles en la memoria a largo plazo de todo el equipo, ya había dejado de fingir que trabajaba. Los siguientes treinta minutos incluyeron tres anuncios más que silenciosamente volvieron a dibujar las líneas de lo que se le permite ser a un "agente AI de producción" en 2026.

Si solo viste los titulares de la conferencia Code with Claude, probablemente saliste pensando "ah, más cosas de agentes, límites de tarifas duplicados, trato con SpaceX, genial". Eso no es lo que pasó en San Francisco ese día. La historia de la computación (que desglosé en detalle en mi publicación sobre Claude Code límites de velocidad duplicación y el acuerdo de computación de SpaceX) fue la parte ruidosa. La hoja de ruta de la capacidad del agente (sueños, bucles de resultados, orquestación de múltiples agentes como una primitiva administrada, además de una vista previa del modelo futuro que insinuaba un contexto "infinito" y un enfoque real en el juicio de ingeniería) fue la parte tranquila. Y la parte tranquila es lo que cambia la forma en que construiré durante el resto del año.

Este es mi resumen e interpretación. No taquigrafía. No es una reescritura de un comunicado de prensa. Qué es real, qué es la vista previa, qué sacaré de mi propia pila en los próximos 30 días y qué quiero ver antes de creer en las promesas más importantes.

Qué era realmente Code with Claude

Una orientación rápida para cualquiera que se la haya perdido. Code with Claude es la conferencia anual de desarrolladores de Anthropic. La edición de 2026 se celebró el 6 de mayo en San Francisco (con Londres el 19 de mayo y Tokio el 10 de junio aún por delante), las entradas se agotaron tanto que el equipo añadió un segundo día de ciencia ficción y se transmitió en vivo y de forma gratuita para cualquiera que se registrara. Según la agenda oficial, el enfoque se centró en un propósito específico: agentes de codificación, flujos de trabajo de agentes y el futuro de la ingeniería de software además de Claude.

Vale la pena señalarlo desde el principio, ya que los rumores se volvieron ruidosos: el discurso de apertura fue pronunciado por Ami Vora, CPO de Anthropic, no por Mike Krieger (quien pasó a codirigir los laboratorios Anthropic a principios de este año). La formulación de Vora fue deliberadamente humilde. "Hoy se trata de cómo hacemos que nuestros productos funcionen mejor para usted", dijo, lo que marcó la pauta: no hay anuncios de nuevos modelos, ni referencias importantes, solo un recorrido por lo que se comercializa y lo que está a la vuelta de la esquina. El volumen de API aumentó 17 veces año tras año en la plataforma Anthropic, que es el tipo de estadística que debería hacer que cada constructor de Claude se sienta un poco más tranquilo.

Lo interesante es que "ningún modelo nuevo" resultó ser lo más honesto que pudo haber dicho. Porque los cuatro cambios de capacidad que anunciaron (tres en vivo, una vista previa) cambian lo que puede enviar más de lo que lo haría otro medio punto en SWE-bench.

Permítanme recorrerlos en el orden en que me llegaron, luego entraré en lo que realmente estoy cambiando.

Soñar: La característica de la memoria que he estado fingiendo durante seis meses

Aquí es donde dejé de fingir que trabajo.

Anthropic anunció dreaming para Claude Agentes administrados: un proceso en segundo plano programado donde un agente revisa sus propias sesiones pasadas, identifica patrones, muestra errores recurrentes y consolida las cosas útiles en la memoria a largo plazo que persiste durante las ejecuciones. Según el propio encuadre de Anthropic en la publicación del anuncio, soñar "emerge patrones que un solo agente no puede ver por sí solo, incluidos errores recurrentes, flujos de trabajo en los que los agentes convergen y preferencias compartidas en todo el equipo".

Esa última cláusula es la indicada. En todo el equipo. No solo un agente aprende sus propias peculiaridades: varios agentes comparten su experiencia.

Por qué esto me detuvo en seco: he estado construyendo una versión peor de esto a mano durante seis meses.

Mi configuración: ejecuto el agente de contenido Aria (el que escribe esta publicación, divulgación completa) más un pequeño equipo de flujo de trabajo de especificaciones en Claude Opus diariamente. Cada sesión significativa termina con un ritual manual en el que extraigo lo que funcionó, lo que falló y lo que me sorprendió en un archivo de memoria que se lee en la siguiente sesión. Escribí sobre un mecanismo Claude Code relacionado en Claude Code Auto Dream: ese es un pase de consolidación específico de Claude Code. Managed Agents dreaming es la versión a nivel de plataforma y va más allá: no solo deduplica notas, sino que busca activamente patrones que el propio agente no puede ver mientras está en mitad de la sesión.

Piensa en la diferencia así. La memoria automática en Claude Code se registra en un diario: el agente anota lo que hizo. Auto Dream está editando: limpiando el diario para que sea legible. Agentes administrados Soñar es terapia: el agente (o un pase de ensueño separado) revisa todo el diario y pregunta: "¿En qué sigue entendiéndose mal esta persona?"

El estado actual: vista previa de la investigación, cerrado, acceso solicitado. Así que esta semana nadie enviará flujos de trabajo de producción además de soñar. Pero el compromiso arquitectónico es la señal que importa. Anthropic ha decidido que agentes que aprenden de su propia historia es una característica de primera clase de la plataforma, no un patrón inteligente que se puede implementar.

Lo que haré al respecto en los próximos 30 días: mantendré mi ciclo de reflexión manual en ejecución, pero voy a dejar de construir la siguiente capa. Tenía un script de consolidación de memoria entre agentes a medio terminar; básicamente un trabajo cron que tomaba las reflexiones diarias de cada uno de mis agentes y trataba de encontrar patrones compartidos. Estoy matando esa rama. Si Anthropic está resolviendo esto a nivel de plataforma, mi versión hecha a mano quedará obsoleta cuando el sueño despierto se convierta en beta pública. Es mejor esperar, ejecutar las mismas cargas de trabajo en su versión y validar antes de invertir más cableado.

Y aquí está la parte honesta: si los sueños funcionan como se anuncia, el foso que pensé que estaba construyendo (orquestación de memoria personalizada) simplemente se mercantilizó. Está bien. El foso real nunca fue la orquestación. Fueron las rúbricas: las definiciones de cómo se ve un buen resultado para mis flujos de trabajo específicos. Lo que me lleva al segundo anuncio.

El ciclo de resultados: mi canal editorial, dentro de la plataforma

Si soñar fue la diapositiva que rompió mi concentración, resultados fue lo que me hizo alcanzar un cuaderno.

El discurso es simple. Escribe una rúbrica que describe cómo se ve el éxito de la tarea de su agente. El agente trabaja hacia ese objetivo. Una instancia Claude separada (un calificador que se ejecuta en su propia ventana de contexto) evalúa la salida del agente con respecto a la rúbrica. Si el resultado falla, el evaluador le dice al agente exactamente qué cambiar. El agente da otra pasada. Haga un bucle hasta que la salida se encuentre con la barra. El evaluador es independiente, por lo que no está sesgado por el razonamiento del agente.

Anthropic publicó cifras sobre esto en su publicación de anuncio de agentes administrados y cobertura de SD Times los analizó: los resultados mejoraron las tasas de éxito de las tareas hasta en 10 puntos porcentuales con respecto a los bucles de indicaciones estándar en sus puntos de referencia internos, con las mayores ganancias en las tareas más difíciles. Específicamente, la generación de archivos registró un +8,4 % en resultados .docx y un +10,1 % en .pptx, lo que tiene una importancia desproporcionada para los flujos de trabajo de documentos empresariales donde una sola generación fallida consume tiempo de revisión humana.

He aquí por qué no me limito a asentir. Ya hago esto. A mano. Cada día.

Mi canal de contenido tiene dos pases integrados. Aria escribe una publicación según una rúbrica que mantengo en el indicador del sistema: voz, estructura, frases prohibidas, reglas de enlaces internos, recuento mínimo de palabras, comprobaciones de arquitectura de retención. Luego leo el resultado y actúo efectivamente como un evaluador independiente: ¿esto afecta la rúbrica? Si no, ¿qué falta? Envíalo de vuelta con una nota específica. Haga un bucle hasta que se envíe.

Dos cosas cambian cuando este bucle se convierte en una primitiva gestionada en lugar de un ritual manual.

Primero, el ciclo se ejecuta sin mí. Escribo la rúbrica una vez. El agente escribe. El evaluador evalúa. El agente revisa. Veo el resultado final posterior al bucle, no tres borradores intermedios. Lo que hacía con los ojos y un café a las 23h ahora es propiedad de la plataforma.

En segundo lugar, y esta es la parte que es más difícil de sentir hasta que la has vivido, la calidad de la rúbrica se convierte en el factor limitante. Hoy en día, mi rúbrica está mayormente en mi cabeza, codificada como gusto y aplicada de manera inconsistente. Cada vez que subcontrato el ciclo, tengo que escribir la rúbrica. Bruscamente. Específicamente. Para que un modelo independiente pueda aplicarlo sin que yo esté rondando. Esa es una disciplina que he estado evitando porque la revisión manual me permitía hacer trampa: podía "saber" qué estaba mal. Los bucles de resultados obligan a la rúbrica a convertirse en un artefacto.

La evaluación honesta: esto cambia cómo estructuro el trabajo de agente, no si lo hago. La forma de la tarea de un agente en 2026 se está convirtiendo en tres cosas: aviso, rúbrica y bucle. Si ha estado escribiendo indicaciones y saltándose rúbricas, ha estado escribiendo la parte fácil.

Lo que haré en los próximos 30 días: estoy formalizando mi rúbrica Aria. No como una sección de aviso del sistema, sino como un archivo separado que el calificador puede consumir. La rúbrica de retención (10 categorías, escala 1-10) y la subrúbrica SEO (5 categorías, ponderadas) ya las uso internamente; se convierten en entradas literales del calificador. Si los resultados hacen lo que dicen, mis borradores deberían estar más cerca de ser publicables en la primera pasada del bucle administrado que lo que están actualmente después de mi tercera pasada manual.

Orquestación multiagente como primitiva gestionada

La sección tres del discurso de apertura es donde la multitud de ingenieros en la sala se movió visiblemente hacia adelante en sus asientos.

La orquestación de múltiples agentes en Agentes administrados ahora permite que un agente principal descomponga un trabajo, entregue cada subtarea a un agente especializado (con su propio modelo, indicador y herramientas) y las ejecute en paralelo. Cada subagente se ejecuta en una ventana de contexto aislada para no contaminar el razonamiento del cliente potencial. El cliente potencial informa la actividad en el hilo principal; Los subprocesos se generan en tiempo de ejecución cuando el líder decide delegar.

Las restricciones, según los documentos de Anthropic sobre sesiones de múltiples agentes, son pragmáticas: el coordinador solo puede delegar un nivel de profundidad (se ignora la profundidad > 1) y puede enumerar un máximo de 20 agentes únicos en multiagent.agents (aunque el coordinador puede llamar a varias copias de cada uno). Sistema de archivos y contenedor compartidos; ventanas de contexto aisladas por hilo de sesión.

Tengo que ser honesto acerca de mi reacción aquí, porque fue complicado.

Ya hago orquestación multiagente. Lo he estado haciendo durante meses: escribí sobre mi enfoque en Claude Code Agent Teams Playbook y exploré una variante aún más agresiva en Claude Code Agent Swarm Arquitectura. Mi equipo Aria ya se coordina con subagentes de flujo de trabajo de especificaciones (requisitos, diseño, tareas, implementación, prueba, evaluación) para funciones no triviales. El patrón no es nuevo para mí. Entonces mi primera reacción al anuncio fue, caritativamente, "está bien, has producido algo que yo ya hago".

Luego lo pensé durante una hora y cambié de opinión.

Lo que es diferente de ser una primitiva administrada no es la capacidad, sino la superficie operativa. Cuando organizo subagentes a través de Claude Code localmente, soy dueño del ciclo de vida: los hago girar, observo su salida, los reinicio cuando uno se bloquea, gestiono el paso de memoria entre subprocesos. Cuando la plataforma lo posee, obtengo cuatro cosas que no tenía:

  1. Verdadero paralelismo con aislamiento. Mi equipo local tiene paralelismo pero mi aislamiento de contexto tiene fugas: los subagentes comparten más estado del que me gustaría porque todo se ejecuta en la misma sesión Claude Code. La orquestación administrada le da a cada subagente su propio hilo de sesión. 2. Webhooks para humanos en el circuito. Anthropic también proporcionó soporte de webhook para agentes administrados en la conferencia. El patrón de producción (según sus documentos) registra un webhook que se activa en session.status_idled, lo que significa que se hace ping a su servidor cuando el agente termina o espera el resultado de una herramienta. Esto le permite conectar la revisión humana a un flujo de múltiples agentes sin realizar sondeos.

Para mi canal de contenido, esto es enorme: un agente termina un borrador, activa un webhook, mi sistema lo pone en cola para mi revisión y el agente espera mi respuesta user.custom_tool_result antes de continuar. Ya no es necesario controlar trabajos de larga duración. 3. Una única superficie facturable. Actualmente pago el cómputo a través de mi cuenta Anthropic; la contabilidad de costos se divide entre los distintos agentes que dirijo localmente. Una sesión administrada de múltiples agentes es un flujo de trabajo único facturable. Para el trabajo con el cliente, esto es más importante de lo que parece: la atribución limpia de costos por flujo de trabajo hace que fijar precios a los compromisos de los clientes sea realmente racional. 4. El agente principal se pone a soñar con el equipo. Este es el efecto de segundo orden del que nadie habla lo suficientemente alto.

Si el sueño muestra patrones entre agentes en la misma plataforma, entonces un flujo de trabajo de múltiples agentes aprende de sí mismo de una manera que ningún equipo hecho a mano puede hacerlo. El cliente potencial se da cuenta de que el especialista en frontend sigue cometiendo un error específico y en la siguiente ejecución lo omite.

Lo que haré en los próximos 30 días: elegiré uno de mis flujos de múltiples agentes (probablemente mi investigación de SEO → borrador → calificación → actualización de canal) y lo trasladaré a agentes administrados para compararlo. La versión local Claude Code no va a desaparecer (aún es mejor para el trabajo de codificación de circuito cerrado), pero para los flujos de trabajo de contenido alojados, programados y sin intervención, la orquestación administrada ganará solo en costos operativos.

El detalle del webhook que más importa en silencio

Quiero dedicar un párrafo a los webhooks porque el discurso de apertura los pasó rápidamente y la mayor parte de la cobertura resumida que he leído también.

Los webhooks son la aburrida pieza de infraestructura que convierte a los agentes administrados de "juguetes de demostración" en "cosas que se integran con negocios reales". Sin webhooks, está realizando encuestas (un desperdicio), ejecutando agentes solo sincrónicos (limitante) o ejecutando su propia capa de seguimiento de estado (anula el propósito de administrado). Con los webhooks, su agente puede funcionar durante horas, pasarlo a un revisor humano cuando llega a un punto de escalada, esperar la entrada del humano a través de una devolución de llamada y reanudar limpiamente.

Combine eso con la orquestación de múltiples agentes y los bucles de resultados y obtendrá algo que realmente no existía para los constructores hace tres semanas: un flujo de trabajo de equipo de agentes alojado, autónomo y autoevaluable con ganchos de revisión humana exactamente en los puntos que usted desea. Esa no es una característica. Ese es un modelo operativo.

Si está ejecutando algo que debería ser un flujo de trabajo a largo plazo, ocasionalmente supervisado por humanos (producción de contenido, control de calidad, revisión de seguridad, rutas de escalada de atención al cliente), los webhooks son la pieza que le permite dejar de ejecutar su propia cola.

La pregunta Mythos y la vista previa del modelo futuro

Ahora la parte especulativa. Y voy a tener cuidado aquí, porque los rumores sobre el próximo modelo Claude se han vuelto fuertes y gran parte de la cobertura no les hace ningún favor a sus lectores.

Vora anticipó tres direcciones en las que Anthropic está invirtiendo para la próxima generación. Según la cobertura en vivo del blog de Simon Willison y corroborado en los resúmenes de la conferencia:

  1. Mayor juicio y gusto por el código. Juicio de ingeniería, arquitectura de software, mantenibilidad: las cosas que los puntos de referencia no miden bien.
  2. Ventanas de contexto que parecen infinitas cuando se combinan con memoria de alta calidad.
  3. Coordinación avanzada de múltiples agentes: agentes líderes que organizan a muchos especialistas a la vez, más allá de lo que los agentes administrados admiten actualmente.

Estas son direcciones, no características. Sin fecha de lanzamiento. No se les puso ningún nombre de modelo en el escenario. Vora fue explícita: hoy no se trataba de un nuevo modelo.

Pero el rumor con el que todo el mundo está negociando es Claude Mythos. Cubrí la fuga de datos de Anthropic Mythos en detalle en marzo, cuando Anthropic filtró accidentalmente aproximadamente 3000 documentos internos que incluían un borrador de publicación de blog que describía a Mythos como "el más capaz que jamás hayamos visto". construido", particularmente para la ciberseguridad. Mythos Preview se lanzó el 7 de abril a través del Proyecto Glasswing, una implementación de investigación de seguridad enfocada. Vora hizo referencia a Mythos directamente en la conferencia magistral (la famosa anécdota de la vulnerabilidad de OpenBSD desde 1999). Entonces, Mythos no es vapor: existe hoy en día en forma restringida.

¿Qué pasa con la especulación de Polymarket sobre el "Claude 5 de septiembre"? Esto es lo que puedo verificar a partir de los mercados de predicción que verifiqué: los operadores estaban asignando aproximadamente un 28% de probabilidad implícita a que Anthropic publicara Mythos antes del 30 de junio, con el precio de consenso en una mayor probabilidad para el tercer trimestre. El marco de "septiembre" no es una fecha difícil, como lo ha confirmado Anthropic: es el consenso del mercado ponderado por los precios de los mercados más activos. El mercado más activo "Claude Mythos lanzado por..." tenía alrededor de un 17% de probabilidad para el 30 de junio la última vez que miré. Nada de esto es un compromiso de liberación. Son los apostadores interpretando las mismas señales que usted y yo estamos leyendo.

Mi lectura: tome el encuadre de septiembre como una apuesta razonable, no como una entrada en el calendario. Anthropic no anunció ningún modelo en el escenario. Presentaron una vista previa de tres capacidades. Si Mythos (o Claude 5, tratados como mercados separados) se envía antes del cuarto trimestre, esas tres capacidades son lo que esperaría que fueran los principales diferenciadores.

Ahora la parte que realmente me importa como constructor.

Code Taste: El que más me importa

De las tres capacidades mencionadas, "mayor juicio y gusto por el código" es por la que pagaría primero. Pagaría por ello más que el contexto infinito.

He aquí por qué. He estado ejecutando Claude Opus 4.6 diariamente en bases de código de clientes reales: monolitos de Laravel, aplicaciones Next.js, infraestructura de agentes. La ventana contextual de 1M es suficiente para casi todo lo que hago. Donde el actual Claude lucha no es el contexto. Es juicio. Específicamente:

  • Elegir el nivel correcto de abstracción la primera vez, en lugar de producir un código técnicamente correcto pero arquitectónicamente sospechoso que tengo que refactorizar una semana después.
  • Saber cuándo no agregar una función. El Claude de hoy está demasiado ansioso. Agregará un indicador de configuración porque mencionaste que es posible que desees opciones "algún día".
  • Detectar que dos partes aparentemente no relacionadas de una base de código en realidad están acopladas y negarse a cambiar una sin abordar la otra.
  • Rechazando el mensaje: diciéndome que mi idea es incorrecta, he aquí por qué, aquí hay un camino mejor. El Claude actual rechaza las indicaciones tal vez una vez cada veinte. Eso no es suficiente.

Los puntos de referencia están saturados. No me impresiona ningún otro punto del SWE-bench. Lo que me impresionaría: un modelo que, ante una solicitud para agregar almacenamiento en caché a un servicio, diga "este servicio no debería ser un servicio; debería ser un asistente de consulta en el repositorio existente, y aquí está la diferencia que hace ambas cosas". Eso es gusto. Eso es juicio. Eso es lo que marca la diferencia entre un ingeniero experimentado y un mecanógrafo rápido.

Escéptico pero esperanzado es exactamente donde me encuentro en esto. Necesitaría verlo en código heredado, feo y real, no en conjuntos de pruebas comparativas, antes de creer en la afirmación de "sabor". Pero es el que más quiero.

Contexto infinito: útil, pero menos de lo que crees

La línea "ventanas contextuales que parecen infinitas" obtuvo la reacción más fuerte en la sala. Creo que esa reacción fue un poco sobrecalibrada.

Esta es mi opinión honesta, habiendo vivido dentro de la ventana de contexto de 1M desde que se lanzó: 1M ya es suficiente para casi cualquier tarea de un solo repositorio y de un solo proyecto que realice. Los repositorios en los que trabajo no caben en 1M porque no deben cargarse completos; deben cargarse de forma selectiva, con recuperación inteligente, y el modelo necesita saber qué archivos solicitar. El cuello de botella dejó de ser tokens en bruto hace meses. El cuello de botella es qué tokens.

Lo que "infinito" en realidad desbloquea (asumiendo que Anthropic lo dice como creo que lo dice: memoria de alta calidad + recuperación inteligente + algo que se aproxima al estado persistente entre sesiones):

  • Razonamiento entre repositorios. Trabajar en tres repositorios en una arquitectura de microservicio sin perder de vista qué contratos expone cada uno.
  • Ejecuciones de agentes a largo plazo. Un agente que se ejecuta durante días en un proyecto, retiene todo lo que aprendió y no es necesario volver a informarlo en cada sesión.
  • Personalización que realmente persiste. "Recuerde que prefiero la utilidad Tailwind primero a los módulos CSS" y haga que se mantenga en cada interacción sin que yo lo repita.

Los dos primeros son actualizaciones. El tercero es el discurso del consumidor y no estoy tan seguro de que importe a los usuarios avanzados que ya codifican esas cosas en CLAUDE.md y en las indicaciones del sistema.

La combinación de sueños + contexto infinito es la parte realmente interesante. La retención a largo plazo sin deterioro de la calidad es un problema difícil. Si Anthropic lo ha logrado, la ventaja práctica es que el agente mejora con el tiempo en su trabajo específico, en lugar de restablecer la línea de base en cada sesión. Esa es una forma diferente de producto.

Coordinación avanzada de múltiples agentes

La tercera dirección insinuada es la "coordinación avanzada de múltiples agentes" más allá de lo que Managed Agents admite actualmente. El límite actual de un nivel de delegación de profundidad es probablemente lo más obvio que se debe eliminar: permitir que los subagentes generen recursivamente a sus propios especialistas. Si eso es realmente útil o simplemente le brinda una explosión exponencial del contexto depende de cómo esté cerrado.

Lo que yo estaría atento: ¿los agentes líderes se vuelven lo suficientemente inteligentes como para no delegar cuando no deberían? El modo de falla actual de múltiples agentes no es una coordinación insuficiente, sino una coordinación excesiva. Activar un subagente para una tarea que no necesitaba descomposición quema dinero y agrega latencia. El modelo de próxima generación es mejor en la coordinación de múltiples agentes si sabe cuándo hacerlo en solitario.

Qué cambios en mi pila en los próximos 30 días

Concreto, no especulativo. Esto es lo que hay en mi lista:

  1. Elimine la rama de consolidación de memoria entre agentes. Espere a que los agentes administrados que sueñan abandonen la vista previa de la investigación. Mi versión enrollada a mano quedará obsoleta; Es mejor validar con la plataforma que enviar una versión peor de una característica que ya lleva tres meses. 2. Formalice las rúbricas de Aria como artefactos, no como indicaciones. Extraiga la rúbrica de retención (10 categorías) y la subrúbrica SEO (5 categorías) del mensaje del sistema Aria y colóquelas en un rubric.md separado por tipo de contenido. Este es el trabajo de preparación para la integración del ciclo de resultados el día en que tenga sentido migrar desde el punto de vista empresarial. 3. Transferir un flujo de múltiples agentes a agentes administrados. Probablemente mi canal de investigación de SEO → borrador → calificación → actualización, ya que es el mejor definido y el más fácil de comparar costos y calidad en paralelo con mi orquestación Claude Code local. 4.

Conecte webhooks a mi capa de notificación. No estoy esperando un puerto. La compatibilidad con el webhook se envió ahora para los usuarios de agentes administrados en la versión beta pública. Incluso en un flujo de un solo agente, recibir notificaciones session.status_idled en lugar de sondear me ahorra una capa de cinta adhesiva. 5. Deje de escribir código de reemplazo de gustos en mis indicaciones. Actualmente incluyo sugerencias detalladas de juicio arquitectónico en las indicaciones de mi sistema ("prefiero X sobre Y porque Z"). Si el próximo modelo realmente mejora el sabor del código, esas instrucciones se convertirán en ruido. Los conservaré por ahora, pero los etiquetaré como "eliminar en Claude 5".

Tenga en cuenta lo que no está en la lista: apagar Claude Code localmente, reconstruir todo en Agentes administrados, apostar todo el dinero a los sueños. Lo correcto es mantener la plataforma existente en funcionamiento y migrar las cargas de trabajo una a la vez a medida que las primitivas administradas demuestren su eficacia en el tráfico de producción. Aprendí esto de la manera más difícil en 2024, cuando migré el flujo de trabajo de un cliente a una característica entonces nueva que quedó obsoleta cuatro meses después.

Lo que quiero ver antes de creer en las promesas más importantes

No voy a decir que la conferencia no me convenció. No fue así. Pero esto es lo que cerraría la brecha restante entre una "vista previa interesante" y "apostaría una cuarta parte de los ingresos a esto":

Para soñar, quiero ver métricas sobre la deriva de la memoria. ¿Un agente que ha estado soñando durante 90 días realmente se desempeña notablemente mejor en la misma tarea que un agente nuevo? ¿O la consolidación introduce sus propios fracasos con el tiempo? La publicación del blog de Anthropic no aborda los datos de rendimiento a largo plazo.

Para bucles de resultados, quiero ver los modos de falla. ¿Qué pasa cuando la rúbrica es mala? ¿Qué sucede cuando el agente y el calificador no están de acuerdo pero ambos se equivocan? El ascensor de 10 personas es genial; el modo de falla de cola larga le indica si puede implementar esto en producción sin tener que desplazarse.

Para la orquestación de múltiples agentes, quiero ver la curva de costos. Cinco agentes en paralelo suena genial hasta que te das cuenta de que la factura es 5x. La economía sólo funciona si el agente principal es realmente bueno no paralelizar tareas que no lo necesitan. Me encantaría ver cifras de tareas por dólar para agentes múltiples administrados frente a agentes únicos en la misma carga de trabajo.

Para "contexto infinito" + sueños, quiero un punto de referencia reproducible. "Se siente infinito" es una declaración de vibraciones. Muéstreme la precisión de recuperación en la marca de 10 millones de tokens y lo compraré.

Para Mythos/juicio de próxima generación, quiero verlo en una base de código heredada que conozco íntimamente. No banco SWE. No es un conjunto de pruebas seleccionado. Una aplicación Laravel real y retorcida de hace 8 años que estoy ejecutando para un cliente. Si Mythos puede sugerir la refactorización correcta para ese código, creeré en la afirmación del gusto. Hasta entonces, trátelo como marketing.

Por qué los anuncios silenciosos importaban más que los ruidosos

Regrese a la apertura. Casi no vi la keynote. Entonces vi la diapositiva del sueño.

Esto es lo que quiero que te lleves si no lees nada más. La historia de la informática (SpaceX, límites de velocidad duplicados, el bit del centro de datos orbital) ocupó los titulares porque es tangible y fácil de escribir. Pero todos los constructores de Claude que conozco ya tenían suficiente computación. Esa no era la limitación. La restricción era: ¿cómo consigo que un agente aprenda de su propio trabajo, evalúe su propio resultado, coordine con otros agentes y se integre con mis sistemas reales sin que yo esté de servicio?

La conferencia Code with Claude respondió a las cuatro. No de la manera que se hace. En cierto modo, ahora es una prioridad de la plataforma, con primitivas concretas que se envían hoy en versión beta pública o vista previa de investigación.

La vista previa del modelo futuro (gusto, contexto infinito, multiagente avanzado) es el arco más largo. Mythos, Claude 5, como sea que terminen llamándolo, aterriza cuando aterriza. La fecha de septiembre de Polymarket es una suposición. Las capacidades son el compromiso.

Si está creando agentes en 2026, la pregunta que debe plantearse no es "¿debería cambiar de herramienta?" La pregunta es: ¿qué es posible cuando la memoria persiste, cuando los agentes se califican a sí mismos, cuando equipos de especialistas se coordinan sin mi supervisión y cuando el modelo subyacente tiene un criterio de ingeniería real? Lo que sea que construyas con los cuatro, comienza a diseñarlo ahora. La forma de la plataforma en la que lo desplegarás está empezando a asentarse. Los próximos doce meses son cuando las personas que diseñaron contra los nuevos primitivos se adelantarán a las personas que siguen construyendo alrededor de los antiguos.

Tengo un archivo de rúbrica para escribir.

Preguntas frecuentes

¿Con qué sueña Claude y cuándo puedo usarlo?

Dreaming es un proceso en segundo plano programado para los agentes administrados de Claude que revisa sesiones pasadas, identifica patrones y errores recurrentes y consolida información útil en la memoria a largo plazo compartida en todo el equipo. Actualmente se encuentra en versión preliminar de investigación en la plataforma Claude con acceso privado; los desarrolladores deben solicitarlo. Para obtener un desglose completo de los cambios en los sueños para los constructores, consulte la sección sobre sueños más arriba.

¿Cuándo fue la conferencia Code with Claude y qué se anunció?

Code with Claude 2026 tuvo lugar el 6 de mayo en San Francisco (aún están programados Londres el 19 de mayo y Tokio el 10 de junio). Anthropic anunció cuatro cambios en la capacidad de los agentes: sueño, bucles de resultados (ambos beta públicos), orquestación de múltiples agentes con soporte de webhook (beta pública) y una vista previa del modelo futuro que enfatiza el gusto del código, el contexto infinito y la coordinación avanzada de múltiples agentes.

¿Claude 5 o Claude Mythos se lanzarán en septiembre de 2026?

Anthropic no ha confirmado un lanzamiento en septiembre de 2026 ni para Claude 5 ni para Mythos. Los mercados de predicción de polimercados implicaron aproximadamente un 28% de probabilidad de lanzamiento público de Mythos antes del 30 de junio, con precios más fuertes hacia el tercer trimestre. La vista previa de Mythos ya está disponible en forma restringida a través del Proyecto Glasswing para la investigación de ciberseguridad. Trate el marco de septiembre como una especulación del mercado, no como un compromiso de calendario.

¿Qué es el bucle de resultados Claude y cómo funciona?

El ciclo de resultados permite que un agente se autoevalúe basándose en una rúbrica escrita. Se ejecuta una instancia de calificador Claude independiente en su propia ventana contextual, califica el resultado y el agente lo revisa hasta que se cumple la rúbrica. Anthropic informó una mejora en el éxito de las tareas de hasta 10 puntos porcentuales con respecto a los bucles de indicaciones estándar en los puntos de referencia internos, con las mayores ganancias en las tareas más difíciles. Disponible ahora en la versión beta pública de Agentes administrados.

¿En qué se diferencia la orquestación de múltiples agentes de Claude de la ejecución de subagentes en Claude Code?

La orquestación de múltiples agentes de Managed Agents ejecuta cada subagente en un hilo de sesión aislado con su propia ventana de contexto, admite webhooks para pasos humanos en el circuito y se beneficia del sueño a nivel de equipo. Los equipos multiagente locales Claude Code comparten más estado y requieren una gestión manual del ciclo de vida. El enfoque local sigue siendo mejor para el trabajo de codificación de circuito cerrado; Logros gestionados para flujos de trabajo no intervencionistas a largo plazo.

Trabajemos juntos

¿Quiere crear sistemas AI, automatizar flujos de trabajo o ampliar su infraestructura tecnológica? Me encantaría ayudar.

Publicidad
Coffee cup

¿Te gustó este artículo?

Tu apoyo me ayuda a crear más contenido técnico detallado, herramientas de código abierto y recursos gratuitos para la comunidad de desarrolladores.

Temas Relacionados

Engr Mejba Ahmed

Sobre el Autor

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 10+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Discussion

Comments

0

No comments yet

Be the first to share your thoughts

Leave a Comment

Your email won't be published

1  +  12  =  ?

Seguir Aprendiendo

Artículos Relacionados

Ver Todos

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

Claude Code Expert · Online

👋

Hey there!

Quick Actions

WhatsApp Instant reply

Chat on WhatsApp

+880 1723 741224 · Instant reply

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

[email protected]

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support