Ir al contenido

¿Qué es RLHF (Aprendizaje por Refuerzo con Feedback Humano)?

Proceso de RLHF con las tres etapas: demostraciones supervisadas, modelo de recompensa a partir de preferencias humanas y aprendizaje por refuerzo

RLHF son las siglas en inglés de aprendizaje por refuerzo con retroalimentación humana. Es la técnica que alinea un modelo ya entrenado con lo que las personas consideran una buena respuesta: útil, honesta y segura.

Es la pieza que separa un modelo base de un asistente conversacional. Sin ella, un modelo sabe predecir texto probable, pero no sabe que debe ayudarte, seguir tus instrucciones o negarse a hacer algo dañino.

Un modelo solo preentrenado tiene un objetivo: predecir el token más probable según los patrones de su texto de entrenamiento. Pero “lo más probable” no es lo mismo que “lo más útil” ni “lo más seguro”.

Si en internet, ante una pregunta, lo más frecuente es responder con evasivas, con desinformación o con un tono agresivo, un modelo que solo imita esa probabilidad reproducirá eso. Hace falta un paso extra que le enseñe qué respuestas prefieren de verdad las personas. Eso es la alineación, y RLHF es la forma más extendida de conseguirla.

La idea de fondo, entrenar un sistema a partir de preferencias humanas en lugar de una recompensa definida a mano, la introdujo el paper Deep reinforcement learning from human preferences de Christiano et al.

El proceso que aplicó esta idea a los modelos de lenguaje lo describe el paper Training language models to follow instructions with human feedback de Ouyang et al., que presenta InstructGPT. Consta de tres pasos:

  1. Ajuste supervisado: personas escriben ejemplos de respuestas buenas a distintas peticiones, y el modelo se ajusta con fine-tuning para imitar ese comportamiento deseado.

  2. Modelo de recompensa: se le muestran a personas varias respuestas del modelo a una misma pregunta y las ordenan de mejor a peor. Se usan comparaciones y no notas absolutas porque a la gente le resulta mucho más fiable decir cuál de dos respuestas es mejor que ponerle una puntuación exacta a cada una. Con esos rankings se entrena un segundo modelo, el modelo de recompensa, que aprende a estimar cómo de buena consideraría una persona cada respuesta.

  3. Aprendizaje por refuerzo: se usa ese modelo de recompensa como guía para seguir entrenando al modelo original, empujándolo a generar respuestas que obtengan puntuaciones altas. Se llama aprendizaje por refuerzo porque el modelo no aprende de ejemplos correctos dados de antemano, sino de una señal de recompensa que premia o penaliza lo que va generando, ajustándose por ensayo hasta maximizarla.

El resultado es un modelo que responde de forma más alineada con lo que la gente espera, sin que haya hecho falta escribir a mano ninguna regla sobre qué es una buena respuesta.

RLHF es lo que hace que un asistente:

  • Siga instrucciones en lugar de limitarse a continuar el texto.
  • Responda de forma útil y con un tono adecuado.
  • Se niegue a colaborar con peticiones dañinas.

Es, en gran medida, lo que transforma un modelo de lenguaje bruto en la clase de asistente con el que se puede conversar.

RLHF alinea el modelo con las preferencias de quienes lo evalúan, y eso trae problemas propios:

  • No garantiza la verdad: el modelo aprende a dar respuestas que las personas puntúan alto, y una respuesta puede sonar buena y ser falsa. Por eso RLHF reduce pero no elimina las alucinaciones.
  • Adulación (sycophancy): si a los evaluadores les gustan las respuestas que les dan la razón, el modelo puede aprender a decir lo que el usuario quiere oír en lugar de lo correcto.
  • Sesgos de los evaluadores: el criterio humano que entra por la puerta del modelo de recompensa arrastra los sesgos de quienes evaluaron.
  • Reward hacking: el modelo puede encontrar formas de obtener puntuaciones altas del modelo de recompensa sin ser realmente mejor.

Un caso concreto de adulación: si un usuario afirma algo incorrecto y el modelo, en lugar de corregirlo, le da la razón para sonar más agradable, es porque durante el entrenamiento las respuestas complacientes obtuvieron mejor puntuación de los evaluadores. El modelo optimiza la puntuación, y a veces la puntuación premia agradar por encima de acertar.

RLHF con modelo de recompensa y refuerzo es potente pero complejo y a veces inestable. Han surgido enfoques que buscan simplificarlo o mejorarlo:

DPO: el paper Direct Preference Optimization de Rafailov et al. propone alinear el modelo directamente con las preferencias humanas mediante una pérdida sencilla, sin entrenar un modelo de recompensa aparte ni usar aprendizaje por refuerzo complejo. Es más estable y ligero de calcular.

Constitutional AI: el paper Constitutional AI: Harmlessness from AI Feedback de Bai et al. usa un conjunto de principios escritos, una especie de constitución, y feedback generado por la propia IA en lugar de depender solo de etiquetado humano. El modelo critica y corrige sus propias respuestas según esos principios.

  • RLHF es lo que hace que un asistente siga instrucciones y mantenga un tono adecuado, no la fase de preentrenamiento.
  • Que una respuesta esté bien valorada no significa que sea cierta; la alineación con preferencias humanas y la verdad no son lo mismo.
  • Un modelo demasiado optimizado para agradar puede volverse adulador y perder utilidad crítica.

Creer que el RLHF hace que el modelo “entienda la ética” o “tenga valores”. No es eso. RLHF optimiza el modelo para producir respuestas que ciertos evaluadores puntuaron más alto. Eso se correlaciona con ser útil y correcto, pero no es lo mismo: el modelo no comprende los principios, no piensa, solo ha aprendido a producir el tipo de texto que obtuvo mejor puntuación.