El Pulso del 24 de marzo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
FlashAttention-4 (Blackwell/Hopper): atención a velocidad de matmul + DSL de kernels en Python
POR QUÉ ENTRA EN EL RADARFA-4 es un “desbloqueo de infraestructura” claro para inferencia en Blackwell (B200/GB200): rediseñan el pipeline en torno al escalado asimétrico (los tensor cores escalan más rápido que exp/memoria compartida). También destaca: implementado por completo en CuTe-DSL embebido en Python, con tiempos de compilación 20–30× más rápidos frente a templates de C++.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Blackwell cambió el cuello de botella: por qué la atención ya no es ‘optimizar matmuls y listo’—y qué implica el enfoque de kernels en Python de FA‑4 para quien construya motores de inferencia.”
OpenAI lanza GPT‑5.4 mini + nano (velocidad/costo + flujos con subagentes)
POR QUÉ ENTRA EN EL RADAROpenAI está apostando de forma explícita al patrón multi-modelo ‘manager + subagentes’: el modelo grande planifica y evalúa; los chicos ejecutan en paralelo. Además: mini tiene 400k de contexto, y miden tool use + OSWorld (uso de computadora), donde la latencia define la sensación del producto.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Se acabó la era del ‘un solo modelo’: cómo diseñar sistemas con un modelo planificador + subagentes baratos (y cuándo nano le gana a un modelo más grande).”
Anthropic: ataques de destilación a Claude a escala industrial (16M de intercambios, 24k cuentas fraudulentas)
POR QUÉ ENTRA EN EL RADAREs una de las crónicas públicas más claras de “exfiltración de capacidades como industria.” No es solo ‘scraping’: es generación dirigida de datos para tool use, coding agéntico e incluso intentos de reconstruir chain-of-thought.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La destilación ya es un riesgo de cadena de suministro: cómo funciona el robo de modelos en la práctica, qué implican los ‘hydra clusters’, y las contramedidas que vienen.”
Claude Code “Remote Control” (sesión local, controlada desde el teléfono/web)
POR QUÉ ENTRA EN EL RADARRemote Control empuja un híbrido pragmático: el agente corre en local con tu filesystem, herramientas y MCP, pero lo podés manejar desde cualquier lado. Es una mejora grande de usabilidad para tareas de coding largas y para equipos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Agente local, cabina remota: por qué este patrón de UX va a dominar (y qué restricciones de seguridad implica).”
ProofShot: “darle ojos a los agentes de coding” con paquetes de prueba registrados
POR QUÉ ENTRA EN EL RADAREl coding agéntico se traba cada vez más en la verificación. El enfoque de ProofShot—video + logs de consola/servidor + artefactos listos para PR—trata las acciones de UI como una traza auditable (un seguro barato contra el “en mi agente anda”).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de confiar en los agentes—empezá a auditarlos: cómo deberían verse los ‘artefactos de prueba’ para UI construida con IA.”
Mozilla AI “cq”: Stack Overflow para agentes (unidades de conocimiento compartidas y confirmadas)
POR QUÉ ENTRA EN EL RADARTodos reinvenimos los mismos fallos de agentes (rarezas de APIs, trampas de CI). cq es un intento concreto de crear un commons de conocimiento portable y legible por agentes, con señales de confirmación (no solo docs estáticas del repo).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes necesitan una internet de memoria: por qué las ‘reglas del README’ por repo no escalan, y cómo las ‘unidades de conocimiento’ podrían volverse el nuevo estándar.”
VLouvain: detección de comunidades Louvain directo sobre vectores (sin armar el grafo O(n²)) — ángulo GraphRAG
POR QUÉ ENTRA EN EL RADARMuchos pipelines de GraphRAG se mueren en el paso de “armar el grafo de similitud”. VLouvain afirma que se puede correr Louvain matemáticamente idéntico sin aristas explícitas, escalando a millones de nodos con memoria O(n·d).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“GraphRAG sin el grafo: cómo la ‘detección de comunidades solo con vectores’ cambia el indexado a escala.”
MSA (Memory Sparse Attention): un framework de memoria latente entrenable que afirma contextos de 100M tokens
POR QUÉ ENTRA EN EL RADAROtra ruta al ‘contexto largo’ que no es ni atención ingenua ni RAG puro: memoria latente dispersa con routing + “document-wise RoPE” para evitar el drift de posición. Aunque los números exactos se discutan, la receta arquitectónica vale la pena estudiarla.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Más allá del contexto de 1M: los 3 patrones de diseño para memoria extrema (atención dispersa, routing y esquemas de posición).”