El Pulso del 15 de mayo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Codex ya está en la app móvil de ChatGPT (relay remoto + aprobaciones)
POR QUÉ ENTRA EN EL RADAREs el cambio de UX de la “era de agentes”: el trabajo de larga duración necesita checkpoints humanos livianos (aprobar, redirigir, aclarar) desde cualquier lado. El detalle clave es el modelo de relay seguro: el trabajo se queda en tu máquina y el estado se sincroniza al teléfono (diffs, tests, pantallas, terminal).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El momento iPhone de los agentes de código: por qué las aprobaciones son la nueva UI.” Demostrá un flujo en 3 pasos: arrancás la tarea en el escritorio → aprobás desde el teléfono → revisás el diff después.
Cómo funciona Claude Code en codebases grandes (búsqueda agéntica + índices de embeddings)
POR QUÉ ENTRA EN EL RADARAnthropic sostiene de forma explícita que el RAG y los índices de embeddings del codebase se vuelven obsoletos a escala organizacional, y que el recorrido agéntico de archivos y la búsqueda tipo grep evitan ese modo de falla. También: el framing “harness + modelo” (CLAUDE.md, hooks, skills, plugins, MCP, subagentes).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de preguntar ‘qué modelo’—empezá a preguntar ‘qué harness’.” Explicá el setup en capas (CLAUDE.md → hooks → skills → plugins → MCP → subagentes) y por qué esa es la verdadera ventaja competitiva para los equipos de desarrollo.
whichllm: elegí el mejor LLM local para tu hardware (recencia + ponderado por evidencia)
POR QUÉ ENTRA EN EL RADARLo novedoso no es “qué entra en VRAM”, sino el ranking por benchmarks fusionados con etiquetas de confianza y una democión por recencia (así los artefactos de leaderboards de 2024 no dominan las elecciones de 2026). Es una respuesta concreta al problema del “caos de modelos open-source”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Comprar LLMs locales está roto—esto lo arregla.” Enmarcalo así: encajar es fácil; elegir el mejor es difícil. Después explicá su filosofía de scoring (niveles de evidencia, penalizaciones por benchmarks viejos, params activos vs. totales en MoE).
Intern-S2-Preview (35B) — modelo multimodal científico + “task scaling” + MTP + compresión de CoT
POR QUÉ ENTRA EN EL RADAREs un release de corte investigativo upstream con varios claims destacados: multimodal científico, “task scaling”, MTP y compresión de CoT.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La próxima scaling law podría ser la dificultad de la tarea, no los parámetros.” Traducí su pipeline a términos de quien crea productos: mejores evals + mejores targets de RL + trazas de razonamiento más cortas = inferencia más barata y mejores resultados.
OpenDeepThink (arXiv) — razonamiento en paralelo con agregación Bradley–Terry (comparaciones pairwise)
POR QUÉ ENTRA EN EL RADAREs una receta limpia de “breadth scaling”: muestreás múltiples soluciones y después las ranqueás con comparaciones pairwise agregadas con un modelo Bradley–Terry (en vez de un scoring frágil de juez único). Reportan grandes mejoras en Codeforces para Gemini 3.1 Pro.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué ‘best-of-N’ está evolucionando a ‘tournament-of-N’.” Explicá Bradley–Terry en 60 segundos y presentalo como un patrón general para planners de agentes: generar → bracket → mutar a los ganadores.
Tensor Similarity (arXiv) — similitud basada en pesos, invariante a simetrías, para interpretabilidad mecanicista
POR QUÉ ENTRA EN EL RADARLa mayoría de las medidas de “¿estas dos redes están haciendo lo mismo?” son solo conductuales (ciegas a OOD) o dependen de la base (se rompen bajo simetrías del espacio de pesos). Esto propone una métrica invariante a simetrías para modelos basados en tensores, con tracking empírico sobre dinámicas como grokking y backdoors.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Una nueva lente para detectar ‘mismo modelo, distinto disfraz’ (y, posiblemente, backdoors).” Framing práctico: los equipos de seguridad e interpretabilidad quieren herramientas algebraicas, no solo prompts de evaluación.
Enforcement de políticas en arXiv: ban de 1 año por “evidencia incontrovertible” de output de LLM sin revisar
POR QUÉ ENTRA EN EL RADAREsto va a cambiar incentivos y flujos de trabajo para autores que usan LLMs: la verificación de citas y los “meta-comentarios de LLM” se vuelven minas de compliance. También es una señal silenciosa de que los venues empiezan a tratar el “LLM slop” como algo colindante con mala conducta científica.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La nueva regla académica de IA: podés usar LLMs, pero no podés tercerizar la responsabilidad.” Dale un checklist: validación de referencias, sacar texto de plantilla, regenerar tablas con números reales, etc.