EL PULSO DE LA IAES

El Pulso del 15 de mayo de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

ModelosAgentesAnthropic
ESCUCHAR ESTA EDICIÓN

El guion de audio está listo; la voz se publicará cuando termine la generación.

  1. 01OpenAI (post de producto)

    Codex ya está en la app móvil de ChatGPT (relay remoto + aprobaciones)

    POR QUÉ ENTRA EN EL RADAR

    Es el cambio de UX de la “era de agentes”: el trabajo de larga duración necesita checkpoints humanos livianos (aprobar, redirigir, aclarar) desde cualquier lado. El detalle clave es el modelo de relay seguro: el trabajo se queda en tu máquina y el estado se sincroniza al teléfono (diffs, tests, pantallas, terminal).

    ÁNGULO EDITORIAL SUGERIDO

    “El momento iPhone de los agentes de código: por qué las aprobaciones son la nueva UI.” Demostrá un flujo en 3 pasos: arrancás la tarea en el escritorio → aprobás desde el teléfono → revisás el diff después.

    Abrir fuente original ↗
  2. 02Anthropic (ingeniería/blog)

    Cómo funciona Claude Code en codebases grandes (búsqueda agéntica + índices de embeddings)

    POR QUÉ ENTRA EN EL RADAR

    Anthropic sostiene de forma explícita que el RAG y los índices de embeddings del codebase se vuelven obsoletos a escala organizacional, y que el recorrido agéntico de archivos y la búsqueda tipo grep evitan ese modo de falla. También: el framing “harness + modelo” (CLAUDE.md, hooks, skills, plugins, MCP, subagentes).

    ÁNGULO EDITORIAL SUGERIDO

    “Dejá de preguntar ‘qué modelo’—empezá a preguntar ‘qué harness’.” Explicá el setup en capas (CLAUDE.md → hooks → skills → plugins → MCP → subagentes) y por qué esa es la verdadera ventaja competitiva para los equipos de desarrollo.

    Abrir fuente original ↗
  3. 03Repo de GitHub (Show HN)

    whichllm: elegí el mejor LLM local para tu hardware (recencia + ponderado por evidencia)

    POR QUÉ ENTRA EN EL RADAR

    Lo novedoso no es “qué entra en VRAM”, sino el ranking por benchmarks fusionados con etiquetas de confianza y una democión por recencia (así los artefactos de leaderboards de 2024 no dominan las elecciones de 2026). Es una respuesta concreta al problema del “caos de modelos open-source”.

    ÁNGULO EDITORIAL SUGERIDO

    “Comprar LLMs locales está roto—esto lo arregla.” Enmarcalo así: encajar es fácil; elegir el mejor es difícil. Después explicá su filosofía de scoring (niveles de evidencia, penalizaciones por benchmarks viejos, params activos vs. totales en MoE).

    Abrir fuente original ↗
  4. 04Model card de Hugging Face

    Intern-S2-Preview (35B) — modelo multimodal científico + “task scaling” + MTP + compresión de CoT

    POR QUÉ ENTRA EN EL RADAR

    Es un release de corte investigativo upstream con varios claims destacados: multimodal científico, “task scaling”, MTP y compresión de CoT.

    ÁNGULO EDITORIAL SUGERIDO

    “La próxima scaling law podría ser la dificultad de la tarea, no los parámetros.” Traducí su pipeline a términos de quien crea productos: mejores evals + mejores targets de RL + trazas de razonamiento más cortas = inferencia más barata y mejores resultados.

    Abrir fuente original ↗
  5. 05arXiv cs.AI

    OpenDeepThink (arXiv) — razonamiento en paralelo con agregación Bradley–Terry (comparaciones pairwise)

    POR QUÉ ENTRA EN EL RADAR

    Es una receta limpia de “breadth scaling”: muestreás múltiples soluciones y después las ranqueás con comparaciones pairwise agregadas con un modelo Bradley–Terry (en vez de un scoring frágil de juez único). Reportan grandes mejoras en Codeforces para Gemini 3.1 Pro.

    ÁNGULO EDITORIAL SUGERIDO

    “Por qué ‘best-of-N’ está evolucionando a ‘tournament-of-N’.” Explicá Bradley–Terry en 60 segundos y presentalo como un patrón general para planners de agentes: generar → bracket → mutar a los ganadores.

    Abrir fuente original ↗
  6. 06arXiv cs.LG (+ código)

    Tensor Similarity (arXiv) — similitud basada en pesos, invariante a simetrías, para interpretabilidad mecanicista

    POR QUÉ ENTRA EN EL RADAR

    La mayoría de las medidas de “¿estas dos redes están haciendo lo mismo?” son solo conductuales (ciegas a OOD) o dependen de la base (se rompen bajo simetrías del espacio de pesos). Esto propone una métrica invariante a simetrías para modelos basados en tensores, con tracking empírico sobre dinámicas como grokking y backdoors.

    ÁNGULO EDITORIAL SUGERIDO

    “Una nueva lente para detectar ‘mismo modelo, distinto disfraz’ (y, posiblemente, backdoors).” Framing práctico: los equipos de seguridad e interpretabilidad quieren herramientas algebraicas, no solo prompts de evaluación.

    Abrir fuente original ↗
  7. 07r/MachineLearning (apunta a un thread de moderadores)

    Enforcement de políticas en arXiv: ban de 1 año por “evidencia incontrovertible” de output de LLM sin revisar

    POR QUÉ ENTRA EN EL RADAR

    Esto va a cambiar incentivos y flujos de trabajo para autores que usan LLMs: la verificación de citas y los “meta-comentarios de LLM” se vuelven minas de compliance. También es una señal silenciosa de que los venues empiezan a tratar el “LLM slop” como algo colindante con mala conducta científica.

    ÁNGULO EDITORIAL SUGERIDO

    “La nueva regla académica de IA: podés usar LLMs, pero no podés tercerizar la responsabilidad.” Dale un checklist: validación de referencias, sacar texto de plantilla, regenerar tablas con números reales, etc.

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md