El Pulso del 29 de mayo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Claude Opus 4.8 (nuevo modelo + “control de esfuerzo” + flujos dinámicos en Claude Code)
POR QUÉ ENTRA EN EL RADAROpus 4.8 afirma mejoras medibles en confiabilidad de agentes (uso de herramientas, trabajo de horizonte largo) y, además, perillas a nivel de interfaz (“esfuerzo”) que cambian cómo la gente opera los modelos día a día.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El cambio de producto que no se ve: de ‘elegir un modelo’ → ‘regular el esfuerzo’ (y cómo eso altera flujos de agentes + costos).”
StepFun “Step 3.7 Flash” (196B MoE / 11B activos) — la eficiencia de agentes como nueva frontera
POR QUÉ ENTRA EN EL RADARPosicionamiento muy explícito en benchmarks agenticos + compatibilidad con harnesses (Claude Code, Hermes Agent, OpenClaw). También empuja un patrón de “modo advisor” (ejecutor chico + advisor más grande de vez en cuando).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El playbook MoE para 2026: pocos parámetros activos + confiabilidad en tool-use le gana a ‘modelo más grande’ para agentes.”
Kog AI: 3.000 tokens/seg por request en GPUs estándar (foco en velocidad de decode de un solo request)
POR QUÉ ENTRA EN EL RADARLa mayoría de los benchmarks públicos optimizan throughput (serving en batch). Kog sostiene que a los agentes les importa la velocidad de decode por request (velocidad del loop de iteración) y muestra velocidades extremas vía co-diseño del stack.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes no son ‘inteligentes’ hasta que son rápidos: por qué tokens/seg por request es la nueva métrica de UX.”
Frontier Governance Framework de OpenAI (documento de alineación regulatoria)
POR QUÉ ENTRA EN EL RADAREs el tipo de documento upstream que los creators van a citar durante semanas, pero pocos leen con atención. Señala cómo los frontier labs van a operacionalizar la EU AI Act + normas a nivel estadual.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Traducir gobernanza a realidad de producto: qué implica para evals de modelos, respuesta a incidentes y cadencia de releases.”
OpenAI: construir agentes impositivos que se auto-mejoran con Codex (trazas de producción → evals → loop de iteración autónomo)
POR QUÉ ENTRA EN EL RADARBlueprint concreto de “agentes que mejoran en producción” usando: feedback de practitioners + captura de trazas + iteración respaldada por evals. Esto está upstream de una ola de contenido sobre ‘self-improving agents’.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El verdadero secreto no es el modelo — es el loop: trazas → hallazgos → targets de eval → fixes en producción.”
Liquid AI LFM2.5-8B-A1B (modelo asistente on-device; contexto 128K; 1.5B activos)
POR QUÉ ENTRA EN EL RADAROtra señal fuerte de que los asistentes edge/on-device se consolidan como pista seria (contexto largo + tool-use + soporte day-one en llama.cpp/MLX). Contenido fácil de ganar: “¿qué podés correr realmente en local ahora?”
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Stack de agentes on-device en 2026: qué importa (params activos, contexto, tool calling e frameworks de inferencia).”
Cloudflare: orquestar code review con IA a escala (revisores multi-agente + coordinador)
POR QUÉ ENTRA EN EL RADARDetalles de un despliegue real y de alto volumen: arquitectura de plugins, agentes revisores especializados, deduplicación del coordinador, tiers de riesgo, defensa ante prompt injection.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Si tu organización ‘solo agrega reviews con IA’ te vas a ahogar en ruido — acá está la arquitectura a la que llegó Cloudflare.”
PR de llama.cpp: usar máscara f16 para flash-attention y ahorrar VRAM
POR QUÉ ENTRA EN EL RADARCambios chicos de infra como este se acumulan en resultados del tipo “¿puedo correr X en local?”. Está upstream de mucho contenido de LLM local y de charla de benchmarking.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“PR chico, impacto grande: cómo el ahorro de VRAM desbloquea contextos más grandes / modelos más grandes en GPUs de consumo.”
YC Paper Club (nuevo upload) — Speculative Speculative Decoding + difusión/MPC + world models
POR QUÉ ENTRA EN EL RADARYC empieza a “empaquetar” research en narrativas amigables para founders. Ir upstream significa: agarrar los papers reales y extraer las 1–2 ideas accionables.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El speculative decoding vuelve a evolucionar — qué les debería importar de verdad a los builders (latencia + costo, no el hype).”
Matt Wolfe “AI News: These Google Updates Are Dividing People” (upload relativamente nuevo) → ir upstream a los docs referenciados
POR QUÉ ENTRA EN EL RADARLos resúmenes de creators van detrás de los docs reales; los docs traen constraints, timelines y el detalle de “qué está shippeando de verdad”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Leé los docs upstream para poder decidir con criterio: qué está shipping vs qué es solo demo en I/O.”