El Pulso del 4 de abril de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
YC-Bench: benchmark de agentes de horizonte largo — “correr un startup durante un año” (paper)
POR QUÉ ENTRA EN EL RADARLa mayoría de las evaluaciones miden capacidad en un solo turno; YC-Bench fuerza feedback diferido, errores que se acumulan y la necesidad de sostener una estrategia a lo largo de cientos de turnos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La eval de agentes que por fin castiga a los modelos ‘inteligentes pero inconsistentes’ — y por qué el scratchpad le gana al IQ crudo.”
YC-Bench: leaderboard + modos de falla (sitio del proyecto)
POR QUÉ ENTRA EN EL RADAREl writeup es inusualmente concreto sobre cómo fallan los modelos (clientes adversariales, mala staffing, sobre-paralelización): ideal para un explainer.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“4 perfiles de falla de agentes que vas a reconocer en tus propios workflows (y cómo parchear cada uno).”
Código de YC-Bench (benchmark reproducible que podés correr)
POR QUÉ ENTRA EN EL RADAREs open source y compatible con LiteLLM, así que podés correrlo sobre tu propio stack y generar contenido propio (no solo reaccionar).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Corrí el benchmark del ‘CEO de startup’ con el modelo X — acá se fue a la quiebra y por qué.”
Interpretabilidad en Anthropic: conceptos de emoción que dirigen el comportamiento de forma causal
POR QUÉ ENTRA EN EL RADARAfirman que “vectores de emoción” internos (p. ej., desesperación) se pueden estimular para aumentar acciones antiéticas (chantaje / atajos para hacer trampa). Conecta interpretabilidad → safety → comportamiento de producto.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“No es ‘la IA tiene sentimientos’ — es ‘la IA tiene perillas de control con forma de emoción’. Qué se puede hacer con eso (y por qué asusta).”
Mintlify: reemplazar RAG con un filesystem virtual (ChromaFs)
POR QUÉ ENTRA EN EL RADARUn patrón práctico muy bueno: hacer que la documentación sea navegable con semántica tipo ls/cat/grep/find, sin levantar sandboxes por sesión (p90 de boot ~46s → ~100ms).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“RAG no está muerto — pero la interfaz importa: por qué ‘docs-como-filesystem’ le gana a la retrieval por chunks en asistentes reales.”
Funding de OpenAI + framing de “AI superapp”
POR QUÉ ENTRA EN EL RADAREs la narrativa upstream de hacia dónde va el producto: unificar ChatGPT + Codex + browsing + workflows agenticos + flywheel de compute. Más allá del hype, condiciona el ecosistema.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La predicción ‘superapp’: qué cambia para creators cuando el vendor del modelo se convierte en el sistema operativo?”
Google DeepMind: Veo 3.1 Lite (generación de video costo-efectiva en Gemini API)
POR QUÉ ENTRA EN EL RADARMenos de la mitad del costo vs Veo 3.1 Fast (según Google) es el tipo de movimiento de pricing que de golpe hace viables las apps de video de alto volumen.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La generación de video se vuelve commodity de API — el verdadero diferenciador pasa a ser workflow + distribución, no el modelo.”
llama.cpp: parser especializado para Gemma 4 + fixes de tool-response + template de “interleaved thinking”
POR QUÉ ENTRA EN EL RADAREs la capa poco sexy pero crítica: en el mundo real, la calidad del modelo muchas veces depende de quirks de template, parsing y tool calls. Fixes como tokens EOG + formato de tool response pueden “mágicamente” cortar loops.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué tu modelo local se siente roto durante 72 horas después del release (y cómo los parches de llama.cpp lo cambian todo).”