Nicole Junkermann

Ideas y tecnología

Nicole Junkermann sobre el aprendizaje por refuerzo, explicado con calma

Una idea que cabe en una frase: probar, recibir una señal y ajustar. Nicole Junkermann la cuenta despacio, con una analogía de cocina y sin promesas.

Nicole Junkermann sonríe en un retrato luminoso, con cortinas claras al fondo
Aprender por repetición tiene más de oficio que de milagro, escribe Nicole Junkermann.

El aprendizaje por refuerzo suena técnico y lo es bastante menos de lo que parece. La idea de fondo cabe en una frase: un sistema prueba algo, recibe una señal que le dice si ha ido mejor o peor, y con esa señal ajusta lo que hará la próxima vez. Repetido muchísimas veces, ese ciclo produce un comportamiento razonable sin que nadie haya escrito de antemano todos los pasos.

Aprender como se aprende a cocinar

La analogía más cómoda es la cocina. Nadie aprende a cocinar solo leyendo. Se prueba, se sirve, alguien pone una cara, y esa cara vale más que media receta. Con el tiempo la mano sabe cuánta sal antes de que la cabeza lo razone, y lo sabe porque ha ido acumulando correcciones pequeñas.

Un sistema que aprende por refuerzo hace algo parecido, sin sabor y sin hambre. Lo que recibe no es un sabor sino un número, y lo que ajusta no es la mano sino una preferencia por ciertas acciones. El mecanismo es distinto; la forma de la curva, muy parecida.

Conviene quedarse con las piezas mínimas, que son pocas y se cuentan rápido:

  • Un entorno donde ocurren cosas y donde cada acción tiene consecuencia.
  • Unas acciones posibles, que pueden ser cuatro o pueden ser muchísimas.
  • Una señal que indica si el resultado ha sido mejor o peor que antes.
  • Muchos intentos, porque una sola prueba no enseña absolutamente nada.

Por qué la paciencia forma parte del método

Aquí está la parte que más se parece a la vida corriente. Este tipo de aprendizaje es lento por diseño. Necesita equivocarse muchas veces para distinguir la suerte del acierto, y necesita que alguien haya elegido bien qué se premia, porque un premio mal elegido enseña justo lo que no se quería enseñar.

Hay además un equilibrio delicado entre repetir lo que ya funciona y probar algo nuevo. Quedarse con lo conocido da resultados aceptables enseguida; explorar cuesta al principio y a veces compensa después. Cualquiera que haya elegido restaurante en una ciudad desconocida reconocerá el dilema sin que se lo expliquen.

Ese es, quizá, el detalle que más se olvida al contarlo. No hay atajo. La mejora llega por acumulación, y la acumulación pide tiempo y una cierta tolerancia al error.

Hasta dónde llega la metáfora

No llega muy lejos, y conviene decirlo. Este método no entiende nada de lo que hace, no tiene intenciones y no sirve para todo. Es una manera concreta de ajustar un comportamiento a base de repetición y de señales, y en su terreno con eso ya resulta bastante útil.

Explicado así, sin ruido, el asunto pierde misterio y gana interés. Nicole Junkermann prefiere ese tono para lo técnico, el mismo que defiende en Escribir cuando toca explicar algo difícil sin simplificarlo de más. La entrada anterior, sobre la inteligencia artificial en la India, mira la misma tecnología desde fuera, y el resto del cuaderno sigue en el blog.