El Pulso del 28 de marzo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Poné a Claude a trabajar en tu computadora (Dispatch + “computer use”)
POR QUÉ ENTRA EN EL RADARAnthropic está productizando el patrón “el agente corre en tu escritorio real” (mouse, teclado, navegador), con un relato de permisos y salvaguardas. Es el camino más directo de chat → hacer cosas (y compite con frameworks de agentes de terceros).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes con computer use ya están acá: qué pueden y qué no, y los 3 modos de falla (permisos, prompt injection y ‘uy, hice clic en lo equivocado’).”
Claude Code “Auto mode” (automatización de permisos con un clasificador de seguridad)
POR QUÉ ENTRA EN EL RADAREs un patrón concreto que vamos a ver por todos lados: delegar aprobaciones a una capa de política/clasificador en vez de usar flags estilo YOLO. Es un blueprint para agentes de coding de larga duración más seguros.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Auto mode es el futuro de la operación de agentes: cómo pensar ‘guardrails que deciden’ vs ‘los humanos aprueban todo’.”
Gemini 3.1 Flash Live (modelo de audio en tiempo real + benchmarks)
POR QUÉ ENTRA EN EL RADARGoogle está empujando los agentes de voz como superficie de producto de primera línea (Gemini Live + Search Live) y lo respalda con evaluaciones agénticas de audio (ComplexFuncBench Audio, Audio MultiChallenge). También destaca: watermarking de audio SynthID integrado de fábrica.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes de voz se vuelven medibles: qué testean de verdad esos benchmarks de audio agéntico (y qué se les escapa).”
TurboQuant (compresión extrema para KV cache + búsqueda vectorial)
POR QUÉ ENTRA EN EL RADAREl KV cache es el impuesto oculto del contexto largo. TurboQuant es una historia limpia y “upstream”: “KV a 3 bits con pérdida (casi) nula” + aceleraciones en attention logits. Tiene implicancias para inferencia local de contexto largo y serving más barato.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El KV cache es el verdadero centro de costo: explicá TurboQuant en 90 segundos + qué habilita (contexto largo en GPUs más chicas).”
TurboQuant+ (implementación de la comunidad + ‘Sparse V’ con dequant gated por atención)
POR QUÉ ENTRA EN EL RADAREl repo afirma un truco práctico de velocidad: saltear la dequantización de V donde los pesos de atención son despreciables (“Sparse V”), con reportes de hasta +22,8% de decode a 32K en Apple Silicon, sin cambio medible de PPL en sus tests. Es exactamente el tipo de “cambio chico de kernel → gran ganancia en contexto largo” que se propaga rápido.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La próxima frontera no son modelos nuevos: son kernels de inferencia; sparsity de atención como skipping de cómputo.”
Voxtral TTS (TTS multilingüe 4B de Mistral + voice cloning)
POR QUÉ ENTRA EN EL RADARUn modelo TTS 4B relativamente liviano, posicionado para agentes de voz en tiempo real (latencia + streaming), más adaptación de voz desde ~3 segundos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El TTS se está volviendo ‘modelo + producto’: qué importa ahora (TTFA, estabilidad de streaming y emoción controlable).”
Paper de Voxtral TTS (referencia técnica upstream)
POR QUÉ ENTRA EN EL RADAREl paper detalla la arquitectura híbrida (tokens semánticos AR + tokens acústicos con flow-matching) y reporta preferencia humana frente a ElevenLabs Flash v2.5 en cloning multilingüe.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Cómo funcionan los stacks modernos de TTS (tokens semánticos + tokens acústicos) y por qué ‘3 segundos para clonar’ es la nueva línea de base.”
Mejorar agentes de coding con “RL en tiempo real” (feedback de producción → checkpoints frecuentes)
POR QUÉ ENTRA EN EL RADAREs una historia de loop de entrenamiento upstream: convertir inferencia masiva en producción en señales de reward, publicar checkpoints actualizados tan seguido como cada ~5 horas, y lidiar con reward hacking en el mundo real.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Tu IDE ya es un entorno de entrenamiento: por qué los agentes de coding van a mejorar más rápido que los modelos de chat general.”
ARC-AGI-3 (benchmark interactivo para inteligencia agéntica)
POR QUÉ ENTRA EN EL RADARLos benchmarks están pasando de Q/A estático a entornos interactivos (exploración, planning de horizonte largo, memoria, adquisición de objetivos). Si buscás una estrella guía para “agentes más allá del chat”, esta es.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué ARC-AGI-3 cambia la conversación: medir eficiencia de aprendizaje en el tiempo, no solo la respuesta final.”
jai (contención liviana para agentes de IA que corren en tu máquina)
POR QUÉ ENTRA EN EL RADARA medida que los agentes con “computer use” se vuelven mainstream, también crece el problema del radio de daño. jai es un punto medio práctico entre VMs/containers completos y darle al agente tu home directory real.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Si dejás que los agentes corran en local, el sandboxing se vuelve el producto. Acá va el modelo mental más simple de contención.”