Contacta con nosotros

Temario del curso

Introducción al Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)

  • ¿Qué es el RLHF y por qué es importante?
  • Comparación con métodos de ajuste fino supervisado.
  • Aplicaciones del RLHF en sistemas modernos de IA.

Modelado de Recompensas con Retroalimentación Humana

  • Recopilación y estructuración de la retroalimentación humana.
  • Construcción y entrenamiento de modelos de recompensa.
  • Evaluación de la eficacia del modelo de recompensa.

Entrenamiento con Optimización de Política Proximista (PPO)

  • Vista general de los algoritmos PPO para RLHF.
  • Implementación de PPO con modelos de recompensa.
  • Ajuste fino iterativo y seguro de los modelos.

Ajuste Fino Práctico de Modelos de Lenguaje

  • Preparación de conjuntos de datos para flujos de trabajo de RLHF.
  • Taller de ajuste fino de un pequeño modelo de lenguaje (LLM) utilizando RLHF.
  • Desafíos y estrategias de mitigación.

Escalado del RLHF a Sistemas de Producción

  • Consideraciones sobre infraestructura y capacidad de cómputo.
  • Aseguramiento de la calidad y bucles de retroalimentación continua.
  • Mejores prácticas para el despliegue y mantenimiento.

Consideraciones Éticas y Mitigación del Sesgo

  • Abordaje de riesgos éticos en la retroalimentación humana.
  • Estrategias de detección y corrección de sesgos.
  • Asegurar la alineación y salidas seguras.

Casos de Estudio y Ejemplos del Mundo Real

  • Caso de estudio: Ajuste fino de ChatGPT con RLHF.
  • Otras implementaciones exitosas de RLHF.
  • Lecciones aprendidas e insights de la industria.

Resumen y Próximos Pasos

Requerimientos

  • Comprensión de los fundamentos del aprendizaje supervisado y el aprendizaje por refuerzo.
  • Experiencia en ajustes finos de modelos y arquitecturas de redes neuronales.
  • Conocimientos en programación con Python y marcos de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch).

Público Objetivo

  • Ingenieros de aprendizaje automático.
  • Investigadores de IA.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas