Oak Lab de Rich Sutton: cómo construir agentes de IA que aprenden solos (y por qué es el futuro)
El padre del aprendizaje por refuerzo acaba de lanzar un laboratorio para crear agentes que aprenden continuamente, sin necesidad de reentrenarse. Hoy te enseño qué significa esto, cómo funciona la arquitectura OaK y cómo puedes empezar a construir tus propios agentes con aprendizaje continuo.
En resumen
- Rich Sutton, premio Turing 2024, lanza Oak Lab para crear agentes de IA con aprendizaje continuo. Te enseño cómo funcionan y cómo empezar a construir los tuyos.
- El padre del aprendizaje por refuerzo acaba de lanzar un laboratorio para crear agentes que aprenden continuamente, sin necesidad de reentrenarse.
- El 13 de julio de 2026, Richard Sutton —ganador del Premio Turing 2024 y co-creador del aprendizaje por refuerzo moderno— anunció la fundación de Oak Lab en Toronto.
🧩 Caso 1: Entender qué es Oak Lab y por qué importa
El 13 de julio de 2026, Richard Sutton —ganador del Premio Turing 2024 y co-creador del aprendizaje por refuerzo moderno— anunció la fundación de Oak Lab en Toronto. Lo hace junto a Khurram Javed, con quien ya trabajó en Keen Technologies, la empresa de IA de John Carmack.
La frase que sacudió el timeline de X no fue diplomática: Sutton llama al deep learning actual "débil e ineficiente" y dice que "no necesita más retoques, sino ideas fundamentalmente nuevas". En junio ya había argumentado que la IA generativa es buena imitando pero incapaz de evaluar sus propias salidas, lo que la deja ciega para el descubrimiento real.
El objetivo a largo plazo es ambicioso: un agente con un billón de parámetros que aprenda y planifique en tiempo real consumiendo solo 20 vatios de energía. Para que te hagas una idea, una RTX 4090 consume 450W. Oak Lab apuesta todo al aprendizaje por refuerzo y a la convicción de que la IA debe aprender de la experiencia durante su funcionamiento, no entrenarse una vez sobre datos estáticos y quedarse congelada.
🧩 Caso 2: La arquitectura OaK explicada sin matemáticas
En NeurIPS 2025 y en la RLC 2025, Sutton presentó la arquitectura OaK (Options and Knowledge). No es un paper académico al uso — es una visión de cómo debería funcionar una inteligencia real.
Los 5 pilares de OaK, según la cobertura de Lambda AI en NeurIPS:
- Aprendizaje continuo: el agente nunca deja de aprender. No hay fase de "entrenamiento" y luego "producción".
- Modelos del mundo: construye representaciones internas de su entorno y planifica con ellas.
- Opciones (Options): el agente crea sus propias subtareas y habilidades reutilizables sin que un humano las defina.
- Meta-aprendizaje: aprende a generalizar, no solo a resolver una tarea concreta.
- Abstracción podable: construye conceptos de alto nivel y descarta los que dejan de ser útiles.
Traducido: en lugar de un ChatGPT que solo sabe lo que vio en su entrenamiento hasta octubre de 2024, OaK imagina un agente que sigue aprendiendo cada segundo que está activo, igual que harías tú al entrar a un trabajo nuevo.
🧩 Caso 3: Tu primer agente con aprendizaje por refuerzo (en 20 líneas)
Vale, Oak Lab está en fase inicial. Pero tú puedes construir agentes con aprendizaje por refuerzo hoy mismo usando herramientas open source. Aquí tienes el stack más usado en 2026:
- Gymnasium (Farama Foundation): entornos estandarizados para entrenar agentes
- Stable-Baselines3: implementaciones probadas de PPO, A2C, SAC y otros algoritmos
- Python 3.10+ con solo 3 dependencias
Instalación en tu terminal:
pip install gymnasium stable-baselines3
Y este es tu primer agente funcional — entrena un CartPole en menos de un minuto:
import gymnasium as gym
from stable_baselines3 import PPO
# Crear el entorno
env = gym.make("CartPole-v1")
# Crear y entrenar el agente
model = PPO("MlpPolicy", env, verbose=1)
model.learn(total_timesteps=10_000)
# Probar el agente entrenado
obs, _ = env.reset()
for _ in range(1000):
action, _ = model.predict(obs)
obs, reward, done, _, _ = env.step(action)
if done:
obs, _ = env.reset()
En mi Raspberry Pi 5 esto tarda unos 45 segundos. El agente empieza sin saber nada y en 10.000 pasos aprende a equilibrar el palo. No es Oak Lab, pero la filosofía es la misma: el agente aprende interactuando con su entorno, no memorizando un dataset.
🧩 Caso 4: De Keen a Oak Lab — lo que cambia respecto a lo que ya existía
Sutton no es un recién llegado al mundo startup. En septiembre de 2023 se unió a Keen Technologies, la empresa de IA de John Carmack (el creador de DOOM). Cuando DeepMind cerró su laboratorio de Edmonton, Sutton se fue a Keen. Ahora da el salto a su propio proyecto.
La diferencia clave entre Keen y Oak Lab: Keen buscaba AGI (inteligencia general artificial) a largo plazo. Oak Lab se centra en agentes que aprenden durante la operación, con aplicaciones más inmediatas. Sutton y Javed no están intentando construir Skynet — están construyendo agentes que no se vuelven obsoletos al día siguiente de desplegarlos.
El anuncio viene acompañado de tres papers fundacionales (aún no públicos en el momento de escribir esto). Y según los detalles que han trascendido, los algoritmos "aprenden en tiempo real sin almacenar ni reproducir datos", lo que reduce drásticamente el consumo de computación.
🧩 Caso 5: Cómo prepararte para la era del aprendizaje continuo
Oak Lab es el futuro. Pero ¿qué puedes hacer tú esta semana para no quedarte atrás?
1. Aprende los fundamentos del RL
El libro gratuito de Sutton y Barto, Reinforcement Learning: An Introduction, sigue siendo la biblia. La segunda edición está completa y es gratis en la web de Sutton.
2. Experimenta con entornos más complejos
Cuando domines CartPole, salta a LunarLander, HalfCheetah o Atari con Gymnasium. Cada entorno te enseña una faceta distinta del problema.
3. Prueba el aprendizaje continuo en pequeño
El truco está en no resetear el entorno entre episodios. Deja que el agente acumule experiencia real, con variaciones en las condiciones iniciales. Así simulas —a escala minúscula— lo que Oak Lab quiere hacer a escala industrial.
4. Sigue de cerca a Sutton
Su perfil en X y su web personal son el mejor termómetro de hacia dónde va el aprendizaje por refuerzo. Los papers de Oak Lab deberían salir en las próximas semanas.
Lo que nos llevamos
Que el padre del aprendizaje por refuerzo diga que el deep learning actual es débil e ineficiente no es un titular vacío. Sutton lleva décadas teniendo razón antes que nadie — su Bitter Lesson de 2019 ya anticipó que la computación bruta ganaría a las ideas ingeniosas diseñadas por humanos.
Ahora su mensaje es: dejad de entrenar modelos una vez y soltarlos al mundo. Construid agentes que aprendan cada día. Personalmente creo que tiene razón — los modelos actuales son fotos fijas de un momento concreto, y el mundo no funciona así.
Mientras Oak Lab construye el futuro, tienes Gymnasium, Stable-Baselines3 y docenas de entornos para empezar a jugar. Si nunca has entrenado un agente de RL, hoy es el día.