EL PULSO DE LA IAES

El Pulso del 28 de julio de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

ModelosAgentesAnthropic
ESCUCHAR ESTA EDICIÓN
El Pulso del 28 de julio de 2026
Ahora en el PulsoTesis editorial de esta edición
Pulso RegusciLabs
El próximo Pulso, directo a vos.
  1. 01Blog técnico de Kimi (primaria)

    Kimi K3 publica pesos abiertos de clase 2,8T

    POR QUÉ ENTRA EN EL RADAR

    Kimi afirma que K3 es un MoE de 2,8 billones de parámetros, con 16 de 896 expertos activos, visión nativa y una ventana de contexto de 1M de tokens; los pesos se habían prometido para el 27 de julio. Sus reclamos —coding de larga duración, trabajo de compiladores/kernels, agentes de investigación y video— convierten esto en un momento genuino de “frontera abierta”, no en un modelo barato más.

    ÁNGULO EDITORIAL SUGERIDO

    “El open source acaba de cruzar los 3 billones de parámetros: ¿qué se puede correr o usar de verdad?” Separar el titular del conteo de parámetros de los parámetros activos, la realidad de hardware, la disponibilidad por API y los resultados verificados de forma independiente.

    Abrir fuente original ↗
  2. 02Google (primaria, 21 jul)

    Gemini 3.6 Flash: la historia de la economía de agentes

    POR QUÉ ENTRA EN EL RADAR

    Google posiciona a 3.6 Flash como un caballo de batalla más barato para agentes: 1,50 USD/M de tokens de entrada y 7,50 USD/M de salida, 17% menos tokens de salida que 3.5 Flash, y mejoras reportadas en coding, uso de computadora y benchmarks de investigación. Flash-Lite apunta a subagentes de alto throughput a 350 tokens de salida por segundo.

    ÁNGULO EDITORIAL SUGERIDO

    “El modelo que abarata a los agentes escribiendo menos.” Mostrar por qué reducir llamadas a herramientas y tokens de salida puede superar ganancias marginales en benchmarks para un flujo de producción.

    Abrir fuente original ↗
  3. 03Caso de estudio de FermiSense (primaria, 27 jul)

    Un fine-tune RL de 500 USD sobre un modelo de 9B reporta superar a modelos de frontera en una tarea real

    POR QUÉ ENTRA EN EL RADAR

    En su flujo de revisión de catálogo, FermiSense reporta que un modelo abierto de 9B afinado con GRPO alcanzó 87,3% frente a 76,9% de su mejor configuración de frontera, a 0,50 USD por cada 1.000 listings. Es un argumento potente para tratar a los modelos de frontera como línea base de generación de datos, no como el sistema final de producción.

    ÁNGULO EDITORIAL SUGERIDO

    “Un modelo chico y afinado le ganó a la frontera: pero no copies el titular.” Explicar las condiciones necesarias: una tarea acotada, un scorer/evaluación confiable, ejemplos propietarios y volumen suficiente para justificar el entrenamiento.

    Abrir fuente original ↗
  4. 04Anthropic / Dario Amodei (primaria, 27 jul)

    La posición de Anthropic sobre pesos abiertos: sin prohibición, pero con tests de capacidad obligatorios

    POR QUÉ ENTRA EN EL RADAR

    Anthropic rechaza de forma explícita una prohibición general de pesos abiertos. Aboga por controles de chips, acción sobre destilación a escala industrial y tests de seguridad obligatorios para modelos suficientemente capaces —abiertos y cerrados—. Es una historia de política matizada en medio del lanzamiento de Kimi.

    ÁNGULO EDITORIAL SUGERIDO

    “Anthropic no pide prohibir los modelos abiertos. Esto es lo que sí pide.” Usar el marco de tres políticas y contrastarlo con el framing de redes sociales.

    Abrir fuente original ↗
  5. 05Changelog de Claude Code (primaria)

    El nuevo default de Claude Code: Opus 5 con contexto de 1M — y equipos de agentes anidados

    POR QUÉ ENTRA EN EL RADAR

    La versión 2.1.220 hace de Opus 5 el modelo Opus por defecto, con ventana de contexto de 1M, y suma allowlists estrictas de red, un hook DirectoryAdded y reenvío para subagentes anidados. La historia del producto no es solo IQ del modelo: es ejecución multiagente más segura y más observable.

    ÁNGULO EDITORIAL SUGERIDO

    “La verdadera actualización de Claude Code no es el modelo: es la plomería de equipos de agentes.” Demostrar el modelo mental: coordinador → subagentes → especialistas anidados, y después explicar por qué importan los permisos y las restricciones de red.

    Abrir fuente original ↗
  6. 06Experimento SlopCodeBench de HumanLayer (análisis primario)

    Los mejores agentes de coding todavía fallan al preservar un codebase en el tiempo

    POR QUÉ ENTRA EN EL RADAR

    En un subconjunto pequeño de 17 checkpoints de SlopCodeBench, HumanLayer reporta a Opus 5 con 4/17 pases estrictos (24%); ningún modelo llegó al final de un challenge con todo pasando. El benchmark revela un hueco que esconden los benchmarks comunes de “issue de un solo tiro”: manejar requisitos que evolucionan sin acumular regresiones.

    ÁNGULO EDITORIAL SUGERIDO

    “Por qué las demos de agentes de coding mienten (un poco).” Contrastar una primera tarea espectacular con la prueba menos glamorosa: ¿puede el agente cambiar el proyecto diez veces sin romper el comportamiento anterior?

    Abrir fuente original ↗
  7. 07Skill Open Agent Teams de AI Builder Club (repo upstream)

    La orquestación de agentes abiertos se vuelve un workflow reutilizable, no un build a medida

    POR QUÉ ENTRA EN EL RADAR

    El proyecto empaqueta un patrón pragmático para despachar cualquier agente CLI en tmux, con señales de completitud basadas en archivos e iteración multi-turno. El upload del 20 de julio de AI Jason lo referenció al argumentar que los “sidekicks” persistentes y la orquestación reducen el desperdicio de contexto y tokens.

    ÁNGULO EDITORIAL SUGERIDO

    “Tu equipo de agentes necesita un protocolo de completitud, no más prompts.” Explicar la capa de confiabilidad poco sexy: workers observables, handoffs durables y un coordinador que pueda reintentar.

    Abrir fuente original ↗
  8. 08Investigación de OpenAI (primaria, 27 jul)

    OpenAI encuentra que el uso de IA ya está reordenando tareas entre cargos

    POR QUÉ ENTRA EN EL RADAR

    A partir de más de 800.000 mensajes de ChatGPT en EE. UU., OpenAI reporta que el 43,5% de los mensajes de trabajo específicos de una ocupación se refieren a tareas asociadas a otra. Experiencia de cliente, diseño, RR. HH., legal y marketing muestran un “cruce de tareas” especialmente alto.

    ÁNGULO EDITORIAL SUGERIDO

    “La IA puede que no reemplace tu cargo: puede robarte el próximo handoff.” Enmarcarlo en una persona que hace el primer 80% de una tarea que antes requería ayuda de legal, datos, diseño o ingeniería.

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md