El Pulso del 3 de julio de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Presentamos GeneBench-Pro — OpenAI
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Esto es upstream y particularmente útil: no es otro lanzamiento de modelo, sino un benchmark para ver si los agentes pueden tomar decisiones científicas desordenadas y cargadas de juicio. OpenAI afirma que GPT-5.6 Sol alcanza un 28,7% de tasa de acierto, y 31,5% en modo Pro, sobre 129 problemas de biología que a menudo les llevan a humanos entre 20 y 40 horas cada uno.
Más detalles sobre las salvaguardas cibernéticas de Fable 5 y el marco de jailbreak de Anthropic
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Anthropic está intentando definir un lenguaje de industria para la severidad de los jailbreaks, en lugar de tratarlos a todos como equivalentes. Es contenido upstream de política e infraestructura que probablemente los creadores reciclen más tarde hoy.
Ampliación de Project Glasswing — Anthropic
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Anthropic afirma que los partners de Glasswing ya encontraron más de 10.000 fallas de severidad alta o crítica, y está expandiendo el programa de ~50 a ~150 organizaciones de infraestructura crítica. Es una señal fuerte de que la frontera entre IA frontier y ciberseguridad está pasando de demo a despliegue operativo.
DiffusionGemma: generación de texto hasta 4 veces más rápida
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Este es uno de los lanzamientos técnicos upstream más interesantes de las últimas dos semanas. Google afirma que un modelo experimental MoE de 26B puede generar texto hasta 4 veces más rápido al dejar atrás la autorregresión token a token y generar bloques de 256 tokens en paralelo.
Computer use llega a Gemini 3.5 Flash
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Google pasó el computer use de un modelo separado a una herramienta integrada dentro de Gemini 3.5 Flash. Eso significa que las acciones agenticas en escritorio, navegador y móvil se están convirtiendo en una capacidad estándar, y no en un SKU especial de demo.
Notas de lanzamiento de GLM-5.2 — Z.ai
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Las notas de documentación upstream afirman 1M de contexto sin pérdida, mayor estabilidad en tareas de horizonte largo, y SOTA open-source en coding y tareas de largo horizonte. Esta es la fuente real detrás de la cobertura de creadores, en lugar de reaccionar solo a takes de YouTube.
DeepSeek V4 Flash termina tareas de coding más rápido que Sonnet y Opus
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Este es un benchmark útil, más o menos upstream, que circula en LocalLLaMA: el DeepSeek V4 Flash local, según reportes, aterriza cerca del territorio de Sonnet en calidad, mientras termina tareas más rápido en tiempo de pared que setups hosted de Sonnet y Opus. La idea clave no es “lo local le gana a la frontera”, sino que el harness y la latencia ahora importan tanto como la calidad cruda del modelo.
Servidor MCP de Safari para desarrolladores web
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Apple/WebKit acaba de darle a los agentes un camino first-party hacia el debugging de Safari: DOM, requests de red, screenshots, salida de consola e interacciones. Es tooling upstream que podría convertirse en un acelerador silencioso para agentes de coding con IA.
Repo de “skills” de AI Builder Club
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Este es el artefacto upstream detrás del contenido reciente de AI Jason. Lo interesante no es el video: es el framing del repo sobre “loops”, memoria compartida basada en archivos, triggers y harnesses de codebase listos para agentes. Buen material fuente para contenido práctico de creadores.