El Pulso del 2 de julio de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Claude Sonnet 5
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Anthropic posiciona a Sonnet 5 como el caballo de batalla agentico más barato: más cerca del rendimiento de Opus 4.8, pero al precio de Sonnet. La historia de fondo no es el lanzamiento crudo del modelo: es el reclamo de que los modelos de gama media ya alcanzan para sostener bucles prolongados de navegador, herramientas y código.
Notas de lanzamiento / docs oficiales de GLM-5.2
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Rio arriba, Z.AI afirma que GLM-5.2 soporta 1M de contexto sin pérdida y alcanza SOTA open-source en coding y tareas de horizonte largo. Varios creators ya lo están cubriendo; eso suele indicar que conviene hablar de los reclamos oficiales, la promesa de longitud de contexto y dónde podrían ganar de verdad los modelos baratos de coding de horizonte largo.
Senior SWE-Bench
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Esto es infraestructura de benchmarks río arriba, no otra publicidad de modelo. El benchmark está explícitamente armado alrededor de tareas de horizonte largo al estilo de un ingeniero senior, que es exactamente el terreno donde se va a pelear la próxima ola de reclamos de agentes de coding.
Leaderboard de CursorBench 3.1
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Cursor publica una evaluación sobre tareas ambiguas y multiarchivo tomadas de sesiones reales. La historia río arriba: los benchmarks prácticos de coding se están alejando del SWE-bench clásico hacia realismo de workflow, costo por tarea y tolerancia a la ambigüedad.
Cómo Cursor construye CursorBench
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Sirve porque ataca de frente la contaminación de benchmarks públicos y explica por qué las evaluaciones de vendors se vuelven más privadas, más desprolijas y más operativas. Buena fuente si buscás un ángulo contrario al teatro de leaderboards.
Presentamos GeneBench-Pro
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es una historia río arriba fuerte porque habla de gusto de investigación, no de exactitud mecánica. OpenAI intenta medir si los modelos pueden bancar análisis biológicos desordenados y cargados de juicio, en lugar de solo recall o tareas de horizonte corto.
Preview de GPT-5.6 Sol
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El ángulo de contenido real no es “OpenAI lanzó otro modelo”. Es que OpenAI ata explícitamente a Sol con Terminal-Bench 2.1, workflows de biología, investigación de exploits y salvaguardas más fuertes. Eso señala que la competencia frontier se está metiendo más profundo en dominios de evaluación agentica.
Kimi K2.7 Code en GitHub Copilot
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗La significancia río arriba es distribución: es el primer modelo open-weight ofrecido en el selector de modelos de Copilot. Aunque el modelo en sí no sea el número uno, el señal de plataforma importa: los modelos open-weight pasan del playground de entusiastas a las superficies default del desarrollador.
Cuantización asimétrica para retrieval de late-interaction
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Mixedbread afirma retrieval late-interaction casi sin pérdida con 97% menos almacenamiento, manteniendo queries en mayor precisión y binarizando los vectores de documentos. Es una historia fuerte de infraestructura río arriba para quien construye sistemas de RAG o búsqueda a escala.
Compute Index: ‘The Middle Class is Dead’
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Fuente secundaria, pero síntesis útil: el mercado se parte entre ‘god models’ caros y ‘flash models’ ultra baratos. Encaja con las señales río arriba de hoy — Sonnet 5, GLM-5.2, Kimi en Copilot y las curvas de costo de CursorBench.