El Pulso del 11 de setiembre de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
La Agents API de OpenAI entra en beta pública
POR QUÉ ENTRA EN EL RADAROpenAI está convirtiendo en producto gran parte del stack de agentes de larga duración: sandboxes gestionados o self-hosted, compactación de contexto, búsqueda de tools a demanda, llamadas programáticas a tools y subagentes en paralelo. El cambio de fondo no es que “exista una API de agentes”; es un harness mantenido que los desarrolladores pueden usar o inspeccionar a través del Codex harness open source.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El framework de agentes se está volviendo infraestructura: qué va a correr OpenAI por vos—y qué sigue siendo tuyo.” Mostrar una tarea partida en subagentes y después explicar dónde los datos propios, las evals y los permisos siguen siendo la parte difícil.
GPT-Live-1: los agentes de voz dejan atrás el pipeline STT → LLM → TTS
POR QUÉ ENTRA EN EL RADARGPT-Live-1 es una capa de voz full-duplex que escucha y habla al mismo tiempo, maneja interrupciones y delega el razonamiento más profundo y el trabajo con tools a un backend. OpenAI reporta casi 80% menos interrupciones en una evaluación temprana con un tutor de idiomas y una mejora de 30 puntos en su Full Duplex Bench frente a GPT-Realtime-2.1.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué los voice bots de hoy se sienten groseros—y la arquitectura que lo corrige.” Hacer un demo en vivo de interrupción y después diagramar capa de voz versus capa de razonamiento. Marcar que las afirmaciones de benchmark del vendor necesitan replicación independiente.
Cognition lanza SWE-2 y convierte el costo del agente de código en un objetivo de entrenamiento de primer orden
POR QUÉ ENTRA EN EL RADARCognition dice que SWE-2 llega a 50.0% en FrontierCode 1.1 Main—a un punto de Fable 5.1, con 64% menos de costo—usando un solo run de RL a través de varios niveles de esfuerzo de razonamiento. El win comportamental que reclama es menos divagar: la mediana del primer edit a los 18 pasos versus 48 para SWE-1.7.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de preguntar cuál coding model es el más inteligente. Preguntá: ¿qué tan rápido hace el primer edit correcto?” Recrear una tarea chica de repo y medir time-to-first-useful-change, tests y gasto total.
Llega DeepSeek V4.1 Flash—y apunta a una estrategia de ‘el modelo rápido se vuelve el default’
POR QUÉ ENTRA EN EL RADAREl changelog oficial dice que los requests a deepseek-v4-pro se van a rutear a V4.1 Flash desde el 14 de septiembre hasta que salga V4.1 Pro, facturados a precio Flash. Eso hace el rollout más interesante que el hype de benchmarks: el vendor está usando ruteo y pricing para mover a los usuarios hacia un default general más rápido.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“DeepSeek está jubilando el ‘Pro’ en favor de Flash: ¿movida de producto inteligente o cebo de benchmarks?” Comparar latencia práctica de coding, confiabilidad de tools y recuperación ante fallos—no solo demos de coding de una sola pasada.
World Labs Atlas: un world model 3D, no meramente otro generador de video
POR QUÉ ENTRA EN EL RADARAtlas se describe como un omni world model que puede generar, reconstruir y simular mundos a través de texto, imágenes, video y 3D usando un contexto espacial compartido. El pitch para creators es control de cámara a nivel de píxel y reconstrucción navegable a partir de imágenes de origen.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Una foto → una cámara que podés mover: por qué esto es distinto del video con IA.” Usar una foto conocida de un cuarto o un producto; demostrar la diferencia entre un clip plausible y una escena consistente que se puede explorar.
Experimento de inferencia local rápida: aproximación del KV cache de capas tardías en Qwen3 8B
POR QUÉ ENTRA EN EL RADARUn experimento fresco de la comunidad aplica un Late Layer KV Approximation Linear Projector a Qwen3 8B, con el objetivo de imitar parte del comportamiento de fast-prefill. Es temprano y no debería presentarse como un reemplazo comprobado del soporte nativo de arquitectura—pero es una historia nítida de ingeniería de LLM local.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“¿Puede un projector chico hacer que Qwen local se sienta dramáticamente más rápido?” Hacer benchmark del prefill exacto versus el aproximado, reportar las regresiones de calidad con honestidad y explicar el KV cache en 30 segundos.
Higgsfield Genjutsu vuelve más orientada a producción la transformación de video a video
POR QUÉ ENTRA EN EL RADARGenjutsu acepta videos de referencia de 3 a 30 segundos y ofrece flujos de transfer de movimiento y swap de objetos, con hasta 40 imágenes de referencia para consistencia. La implicancia para creators: conservar la performance y el timing de un clip real mientras se cambia el elenco, el producto, el vestuario o el set, sin refilmar.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El workflow práctico de publicidad: filmar una vez, armar cinco versiones.” Usar el mismo clip de producto de 10 segundos para crear variaciones; reportar créditos, resolución, artefactos y dónde empiezan los riesgos legales y de brand-review.
La detección de video con IA sirve como triage, no como prueba
POR QUÉ ENTRA EN EL RADAREl scanner open source chequea señales visuales, reviews de Gemini, content credentials y disclosures de origen—pero su propia evaluación dice que la comparación reservada no mostró una mejora de accuracy, y se le escapó un clip generado de origen conocido. Esa franqueza es la historia: la procedencia y las disclosures son evidencia más fuerte que un score de detector.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Probé un detector de video con IA—y su feature más importante es admitir que puede equivocarse.” Correr ejemplos generados, de cámara, CGI, republicados y con credentials; explicar falsos positivos y falsos negativos.