Un nuevo modelo abierto de Reflection AI, OpenAI marcando texto para cumplir en la UE, un modelo de 125B metido en una GPU de 12 GB y Google recortando lo que dan sus planes baratos de Gemini: qué cambió y qué significa si usas IA en tu propia máquina.
El nuevo competidor de pesos pesados
Lo que pasó. Reflection AI presentó Beam, un modelo de tipo mixture-of-experts que solo procesa texto (techcrunch.com). La empresa tiene una valoración de 25.000 millones de dólares tras su última ronda. Planean publicar los pesos este mes. El modelo cuenta con 501 mil millones de parámetros y 23 mil millones activos. Fue entrenado con 23,8 billones de tokens. Para asegurar chips hasta 2029, Reflection firmó acuerdos por más de 7.000 millones de dólares.
Lo que pensamos. Otra empresa con miles de millones de dólares prometiendo eficiencia. El uso de pesos abiertos es bienvenido. La escala de inversión es asombrosa.
Lo bueno. El modelo ofrece una ventana de contexto de 1 million tokens para tareas complejas (techcrunch.com).
Qué haces tú con esto. Si necesitas potencia sin depender de nubes cerradas, mira esta IA local para developers.
Marcas de agua para cumplir la propiedad
Ilustración generada con IA en nuestra máquina.
Lo que pasó. OpenAI añadirá una función de API con marcas de agua de texto para usuarios en la Unión Europea (cryptobriefing.com). Esta medida busca cumplir con las reglas del EU AI Act. Los artículos 50 de la normativa entraron en vigor el 2 de agosto de 2026. El plazo para sistemas existentes termina el 2 de diciembre de 2026.
Lo que pensamos. Las grandes tecnológicas siempre encuentran la forma de adaptarse a la regulación europea. Es un movimiento necesario para evitar sanciones. La transparencia técnica es el objetivo.
Lo bueno. Un prototipo interno de OpenAI alcanzó una efectividad del 99,9 % en 2024 (cryptobriefing.com).
Qué haces tú con esto. Consulta la guía EU AI Act para entender el impacto en tus proyectos.
Gigantes en hardware de consumo
Ilustración generada con IA en nuestra máquina.
Lo que pasó. Strata ejecutó el modelo Qwen3.8-Flash-Next de 125 mil millones de parámetros en un PC de juegos (hwupgrade.it). El proceso requiere unos 80 GB de espacio libre en disco, 12 GB de VRAM y 32 GB de RAM. En una GeForce RTX 5070 con 12 GB, la cuantización Q2_0 alcanza 94 tokens/s. El sistema carga entre 35 y 55 GB en memoria durante el inicio.
Lo que pensamos. Es impresionante ver cómo la optimización permite usar modelos masivos en hardware doméstico. La técnica de decodificación especulativa ayuda a ganar velocidad.
Lo bueno. La velocidad de generación es muy alta para un modelo de este tamaño (hwupgrade.it).
Qué haces tú con esto. Verifica si tu tarjeta gráfica es suficiente con la calculadora de VRAM.
Google recorta beneficios en sus planes
Ilustración generada con IA en nuestra máquina.
Lo que pasó. Google limitará el acceso a modelos nuevos para usuarios gratuitos y sus modelos de suscripción (androidauthority.com). Los usuarios gratuitos solo usarán Gemini 3.5-Flash-Lite. Los suscriptores de AI Plus, con un coste de $4.99 al mes, perderán acceso a Gemini 3.1 Pro. Estos cambios se aplicarán el 9 de octubre.
Lo que pensamos. Un plan barato que pasa a costar menos de mantener sigue siendo un plan barato, solo que con menos dentro. Es una decisión de negocio legítima; menos elegante si montaste algo sobre Gemini 3.1 Pro con AI Plus y te enteras por un blog.
Lo bueno. Los suscriptores de los niveles Pro y Ultra no sufrirán estas restricciones (androidauthority.com).
Qué haces tú con esto. Si algo tuyo depende de Gemini 3.1 Pro en una cuenta gratuita o AI Plus, revísalo antes del 9 de octubre. Para el trabajo que no debe cambiar cuando un proveedor cambia sus planes, mira qué hardware mueve qué modelo.
En una frase
La IA local gana terreno frente a las restricciones de servicios gestionados y las nuevas normativas europeas.
Trabaja con nosotros
Si quieres ayudarnos a analizar el futuro tecnológico, escríbenos a /contact o solicita nuestra /consulting.