El Pulso del 27 de abril de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
SWE-bench Verified ya no es un buen benchmark frontier de coding
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗OpenAI está diciendo en público que el benchmark quedó “benchmaxxed”: tests defectuosos rechazan soluciones correctas y la contaminación hace que los puntajes reflejen más exposición al entrenamiento que capacidad real. Es un tema grande para cómo toda la industria comercializa agentes de coding.
OpenAI lanza Privacy Filter (modelo open-weight de detección y redacción de PII)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es un modelo chico, de alto throughput y pensado para correr en local, orientado a redactar PII con contexto largo (hasta 128k tokens). La arquitectura combina clasificación de tokens con decodificación de spans (Viterbi). Es “infra aburrida” que, en silencio, habilita adopción enterprise (logging, indexación, creación de datasets, pipelines de eval).
Llega GPT-5.5 (el nuevo flagship de OpenAI) y lo que implica para agentes
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El posicionamiento es muy explícito: menos prompt engineering, más autonomía, uso de tools y trabajo de horizonte largo. También: están enfatizando eficiencia de tokens y “flujos agentic” más que velocidad cruda.
Claude Design (Anthropic Labs): diseño conversacional → export → handoff a Claude Code
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Acá el “design-to-code” pasa a ser nativo dentro de un producto LLM: el onboarding arma y lee un design system, hay sliders y controles iterativos, exporta a HTML/PPTX/Canva y empaqueta un “handoff bundle” hacia Claude Code.
gstack de Garry Tan: convertir Claude Code en un ‘equipo virtual’ (open source)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es un playbook concreto y con opiniones fuertes para flujos de ingeniería agentic (office hours → plan → review → QA → ship), empaquetado como slash commands repetibles. Aunque no lo adoptes, funciona como “espécimen” de cómo builders de élite están productizando el leverage de la IA.
Prompt API de Chrome: Gemini Nano on-device en el navegador (origin trials)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Las llamadas a un LLM local dentro del browser se están convirtiendo en un primitivo web estándar: clasificación, Q&A sobre la página, summarization, extracción, extensions. Las restricciones (storage, RAM/VRAM, download, user activation) importan si querés shippear IA “private by default” de cara al consumidor.
hipfire
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El stack de IA local se diversifica más allá de CUDA. hipfire apunta a GPUs RDNA de consumo y pro, con una UX “estilo Ollama” y un modo server compatible con OpenAI. Forma parte de una tendencia más amplia: los motores de inference se están volviendo superficies de producto.
China ordena deshacer la adquisición extranjera del proyecto Manus (agentes de IA)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Es una señal rara y directa: las compañías de agentes de IA están siendo tratadas como activos estratégicos. Aunque no cubras geopolítica, esto afecta dónde se concentran talentos, modelos y lanzamientos de producto.