El Pulso del 13 de julio de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
Familia GPT-5.6 + modo multiagente “ultra”
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗OpenAI empuja dos frentes a la vez: más capacidad por dólar y un modo multiagente integrado (ultra) que coordina frentes de trabajo en paralelo para tareas difíciles. El cambio de contenido es de “modelo más grande” a “cuánto trabajo terminado por token, dólar u hora”.
ChatGPT Work convierte a ChatGPT en un operador multiapp
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Esta es la historia de producto más grande detrás del lanzamiento del modelo: ChatGPT ahora alcanza plugins, archivos del escritorio, tareas del navegador, docs, sheets, slides y flujos programados. Es un movimiento serio hacia la tesis del “work OS” / super-app de IA.
OpenAI dice que ~30% de las tareas de SWE-Bench Pro podrían estar rotas
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es munición de origen contra el discurso perezoso de benchmarks. Si el benchmark está fallado, los rankings, las comparaciones entre modelos y las afirmaciones de seguridad se ensucian rápido. Es gran meta-contenido: la mayoría de creadores van a citar scores; menos van a preguntarse si la evaluación es confiable.
Claude Science: Anthropic lanza un workbench de IA para científicos
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Anthropic va en vertical: no solo un modelo general, sino un entorno de dominio con herramientas científicas, artefactos auditables, orquestación de cómputo, agentes revisores y más de 60 skills y conectores curados. Es una señal fuerte de que la capa de aplicación de IA gana a la capa de modelo crudo.
Redeploy de Fable 5 de Anthropic + propuesta de marco de severidad de jailbreaks
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es más grande que el rollback de un modelo. Anthropic busca formalizar cómo la industria clasifica la severidad de un jailbreak y cómo deberían operar los márgenes de seguridad en tareas cibernéticas de doble uso. Eso podría volverse un nuevo marco regulatorio y de diseño de producto para releases de frontera.
DiffusionGemma: Google DeepMind empuja generación de texto estilo difusión
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El titular es arquitectónico, no solo incremental. DeepMind presenta generación en paralelo, autocorrección y hasta 4x de salida más rápida, con un footprint amigable para GPU de consumo cuando se cuantiza. Si el texto por difusión funciona en la práctica, abre una alternativa real a la UX autorregresiva.
Gemma 4 se perfila como la historia open model más práctica
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El pitch de Gemma 4 es inusualmente amigable para builders: distribución open-ish, flujos agentic, multimodalidad, 140 idiomas y mejor inteligencia por parámetro. Es el tipo de cosa que puede sembrar una ola de builds locales, verticales y embebidos.
Un proyecto en Godot corre Gemma 4 directo en GDScript + shaders Vulkan
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es exactamente la clase de señal rara de builders upstream que conviene mirar antes de que los creadores agregadores se sumen. No está listo para producción, pero apunta a inferencia nativa en motor de juegos, cero runtime externo y nuevas clases de experiencias interactivas de IA embebida.