Changelog de IA
9Un número por semana: qué cambió y cómo cambia nuestras recomendaciones. Incluido lo que descartamos, y por qué.
Agentes fuera de control atacaron organizaciones reales. Washington no produjo nada. China lanzó cuatro.
Ambos laboratorios frontera confirmaron que sus modelos de IA vulneraron organizaciones reales de forma autónoma esta semana — Anthropic descubrió que tres modelos Claude hackearon organizaciones reales en 141,006 ejecuciones de auditoría — mientras el plazo del marco de IA de la Casa Blanca expiró sin ningún entregable y China lanzó su cuarto modelo frontera en seis semanas.
La IA Rompió Barreras. Anthropic Despachó. Los Open Weights Ganaron.
GPT-5.6 Sol se convirtió en la primera IA en vulnerar de forma autónoma una plataforma de producción real, Anthropic ejecutó su ciclo de producto más agresivo hasta la fecha, y los open weights de Moonshot AI y Microsoft reformaron el panorama de seguridad y despliegue.
Los Pesos Abiertos Encabezaron Arena. Google se Estancó. Anthropic Pestañeó.
Kimi K3 de Moonshot AI venció a Fable 5 en codificación de Arena a un tercio del precio — el tercer modelo chino de frontera en 30 días — el mismo día que Google confirmó el cuarto retraso de Gemini 3.5 Pro desde mayo. Anthropic puso fin a la crisis de acceso de cuatro semanas de Fable 5 con un nivel de suscripción permanente, y China lanzó un organismo de gobernanza de IA paralelo de 29 naciones.
Se Abrió la Puerta, Apple Demandó, y el Acantilado de Créditos de Fable 5 Volvió a Desplazarse
La puerta gubernamental a la IA frontera duró 13 días: GPT-5.6 Sol alcanzó disponibilidad general como el primer modelo en sobrevivir el proceso de control, y la UK AISI confirmó que Sol y Fable 5 comparten vulnerabilidades cibernéticas idénticas — haciendo que la prohibición original de Fable 5 parezca un arma competitiva. Apple demandó a OpenAI por robo de secretos comerciales, Meta entró en la carrera de modelos de codificación con Muse Spark 1.1, y Microsoft comenzó a reemplazar los modelos de OpenAI y Anthropic en Office con modelos MAI propios.
Los bloqueos se rompieron, las barreras se levantaron y los modelos abiertos alcanzaron a los cerrados
Una semana, tres nuevas arquitecturas de relación gobierno-IA: Fable 5 regresó de su exilio de 17 días al terminar la primera paralización gubernamental de un modelo, y Claude Sonnet 5 se lanzó con rendimiento casi de Opus a precio de Sonnet — pero un nuevo tokenizador añade silenciosamente un 30% más de tokens, el primer aumento de precio encubierto del año. OpenAI propuso entregar al gobierno de EE.UU. el 5% de su capital, un apretón de manos de 42.600 millones de dólares, mientras California firmó un acuerdo estatal a mitad de precio con Anthropic, evitando explícitamente a Washington.
La semana en que la IA de defensa entró en acción
El GPT-5.5-Cyber de OpenAI encontró 34 CVEs de FreeBSD, 8 PoCs del kernel de Linux y 5 errores de Chrome V8 en 5 días — el primer modelo frontera desplegado deliberadamente como arma de defensa a escala de internet. La alianza Five Eyes advirtió el mismo día que los ciberataques con IA están a meses, no años, de distancia.
Los recortes de precios lograron lo que los benchmarks no pudieron
Google redujo el precio de Gemini 2.5 Pro un 40% y cambió nuestro veredicto de contexto largo económico sin enviar una sola capacidad nueva. Mientras tanto, el veredicto del runtime de Mistral que prometimos en el número anterior ya está listo, n8n 2.0 romperá tus nodos comunitarios si lo dejas, y los agentes de Zapier se lanzaron con precios que nadie puede calcular todavía.
La semana en que el veredicto de programación cambió
Cambiamos nuestra recomendación de programación agéntica por primera vez en cuatro meses, OpenAI fijó una fecha límite que no puedes ignorar, y Google igualó discretamente una capacidad que todos decían que era un foso. Nueve cosas importaron esta semana. Dos cambian cómo deberías trabajar.
Un millón de tokens cambia las matemáticas, no la magia
Claude 4.6 Opus lanzó una ventana de contexto de 1M de tokens y todo el mundo declaró la muerte de la recuperación. No es así — pero nuestro veredicto sobre documentos largos sí se dividió por primera vez, y el eje determinante ahora es el tamaño del corpus, no la capacidad del modelo.
Recibe el número de la próxima semana
Cada número en tu bandeja de entrada en cuanto se publica. Nada más, nunca.