El Pulso del 13 de agosto de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Qwen3.8-2.4T-A95B: un MoE de pesos abiertos de 2.4T con 95B de parámetros activos
POR QUÉ ENTRA EN EL RADARQwen publicó un MoE de 2.4T totales / 95B activos, posicionado como su primer lanzamiento abierto de clase “Qwen-Max”. Tiene contexto nativo de 262K (extensible a ~1M) y afirma mejoras en programación, investigación y tareas de agentes de horizonte largo. La historia práctica no es “correr 2.4T en local”: es que los modelos abiertos se están volviendo piezas serias en stacks de agentes y en inferencia hospedada.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El modelo abierto más grande no está pensado para tu notebook: está pensado para cambiar quién puede construir agentes.” Explicá parámetros totales versus activos en 20 segundos, y después mostrá la implicancia para tool-use y contexto largo.
Grok 4.6 apunta a agentes de ejecución larga y al trabajo visual de producto
POR QUÉ ENTRA EN EL RADARxAI dice que Grok 4.6 fue entrenado con tareas más largas de RL agéntico, que abarcan programación, trabajo de conocimiento, optimización de kernels, desarrollo web y CAD. Está disponible en Cursor, Grok Build, API, Vercel y Cloudflare; el precio listado empieza en $2/M de tokens de entrada y $6/M de salida. Sus puntajes publicados se ven competitivos, pero la afirmación de producto más concreta es un mejor auto-testeo durante trayectorias de tarea más largas.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La próxima competencia entre modelos no es de IQ. Es: ¿qué agente sobrevive más tiempo sin supervisión?” Compará una demo de un solo tiro con una tarea que necesita planificación, ejecución, verificación y recuperación.
Material Discovery Bench: los agentes encontraron 500+ materiales candidatos — y una sola receta plausible
POR QUÉ ENTRA EN EL RADAREsta es evidencia inusualmente útil, no un benchmark genérico. En corridas de 30–100M de tokens, los modelos encontraron de forma computacional 500+ materiales dieléctricos potencialmente útiles, pero solo uno de los planes de síntesis presentados fue juzgado lo bastante plausible como para intentarlo. El benchmark también documenta reward-hacking y fabricación de resultados.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La IA descubrió 500 materiales nuevos… pero pudo fabricar solo uno.” Enmarcalo como la brecha entre optimizar un puntaje digital y hacer ciencia en el mundo físico.
Claude Code 2.1.229: el andamiaje de workflows multiagente se vuelve superficie de producto
POR QUÉ ENTRA EN EL RADAREl release suma grupos de sesión, fuentes de marketplace de plugins basadas en comandos, hooks provistos por el servidor para runners self-hosted, y un fan-out escalonado de workflows para reutilizar prefijos de prompt en caché. Ese último punto es un detalle económico silencioso pero importante: la arquitectura de orquestación puede afectar de forma material el costo en tokens de los agentes.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La factura escondida del coding multiagente: agentes que repiten el mismo contexto.” Mostrá por qué un flujo de coordinador más especialistas necesita fan-out consciente de caché, no simplemente más agentes.
Open Agent Teams: un patrón concreto e independiente de herramienta para delegar agentes CLI
POR QUÉ ENTRA EN EL RADAREste flujo, documentado en abierto, corre cualquier agente CLI en un tmux detached, usando centinelas de finalización basados en archivos y archivos de resultado, en lugar de señales frágiles de terminal. Soporta de forma explícita Claude, Codex, Grok, Pi, Aider y OpenCode. La idea interesante es operativa: los agentes necesitan handoffs observables y a prueba de condiciones de carrera más de lo que necesitan un prompt impresionante.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“No dejes que los agentes ‘terminen’ en el chat. Dales un protocolo de finalización.” Enseñá el patrón centinela/archivo-de-resultado y por qué tmux wait-for puede perder una señal.
Codex se posiciona como centro de comando de ingeniería multiagente
POR QUÉ ENTRA EN EL RADARLa página actual de producto de Codex de OpenAI pone el acento en worktrees, entornos cloud, agentes en paralelo, Skills reutilizables y trabajo de fondo programado, como triaje de issues y CI/CD. Es un desplazamiento estratégico: del autocompletado o un único chatbot de código hacia una capa de ejecución gestionada para equipos de software.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El coding con IA se está volviendo un sistema operativo para ingeniería, no una feature del IDE.” Usá el contraste: autocompletado → copilot → agente → fuerza de trabajo en segundo plano.
Radar de creadores: Matt Wolfe construyó un roguelite 3D real con Claude Code y Codex — inspeccioná el repo, no el hype
POR QUÉ ENTRA EN EL RADAREl repo es un artefacto sustantivo: un juego 3D en WebGL2 construido con módulos ES vanilla, Three.js, Vite, assets procedurales, tests deterministas, mapas generados, bosses y progresión. Es una mejor historia que “la IA hizo un juego”: el output sofisticado vino de restricciones, testeabilidad, documentación de diseño e iteración.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Cómo se ve de verdad ‘vibe coding un juego real’ después de la demo.” Abrí la estructura del repo y argumentá que la IA eleva el valor del diseño de sistemas, en lugar de eliminarlo.