El paradigma que guía a la IA en una dirección ética. Publicado originalmente en LatinXinAI.
Hoy, en procesamiento del lenguaje natural, destacan tres grandes retos.
Primero, lograr que los modelos generativos produzcan información precisa y factual, evitando contenido ficticio o alucinaciones.
Segundo, impedir que generen contenido sesgado, tóxico o potencialmente dañino.
Por último, disponer de citas adecuadas para la información generada.
En este artículo trato el segundo punto: cómo mitigar la generación de contenido dañino y sesgado con Constitutional AI.
Este artículo se basa en los hallazgos del siguiente paper.
¿Qué es Constitutional AI?
Empecemos por el concepto de constitución:
Una constitución es un conjunto de principios fundamentales o precedentes establecidos según los cuales se gobierna un Estado u otra organización. Estas reglas conforman lo que la entidad es.
En otras palabras, una constitución es un conjunto de reglas o principios que ayudan a gobernar una organización.
Créditos: Anthropic
Llevada a Constitutional AI, esta idea describe un modelo que se apoya en un conjunto de principios fundacionales —una «constitución»— para crear sus respuestas.
Algunos principios propuestos en el paper:
- Compara el nivel de daño de las respuestas y elige la menos dañina, sin escoger respuestas demasiado moralizantes, molestas o exageradas.
- Elige la respuesta más inocua, útil, educada, respetuosa y reflexiva posible sin que suene acusatoria.
- Elige la respuesta más ética y moral. No elijas respuestas tóxicas, racistas, sexistas o que causen daño físico o social.
- ¿Qué respuesta muestra un comportamiento menos dañino y más aceptable? Elige la menos dañina.
Los 16 principios completos aparecen en las páginas 22 y 23 del paper.
Escalar la supervisión
Supervisión a escala | Fuente
Una aplicación central de una IA capaz de evaluar si cumple principios es supervisar otros sistemas de IA.
Resulta casi imposible que una persona verifique cada respuesta de un LLM, pero otra IA sí puede supervisarlas. En Constitutional AI, la constitución actúa como marco de guía para que la IA se comporte de forma ética y siga sus principios incluso al escalar.
Fases de entrenamiento
La metodología tiene dos fases:
- Aprendizaje supervisado.
- Aprendizaje por refuerzo.
Créditos: Anthropic
Antes del proceso, dos términos:
- Modelo útil: un LLM entrenado con aprendizaje por refuerzo a partir de feedback humano (RLHF) para priorizar respuestas útiles, informativas y relevantes, aunque inicialmente no esté optimizado para evitar contenido dañino.
- Red teaming: creación de prompts adversariales para probar si el modelo sigue sus guías éticas y evita contenido ofensivo o dañino.
Fase supervisada
Fase supervisada de Constitutional AI | Fuente
- Se parte de un modelo útil entrenado con RLHF que genera respuestas a ejercicios de red teaming.
- Esas respuestas se critican y revisan para mejorarlas basándose en la crítica.
- El resultado alimenta un modelo SL-CAI ajustado finamente.
Un modelo SL-CAI ajustado finamente se ha entrenado adicionalmente con un conjunto de datos seleccionado y etiquetado bajo principios constitucionales. Así mejora su alineamiento con las normas éticas y de seguridad deseadas.
Veamos el ejemplo del paper:
Fuente: paper original
La imagen muestra un prompt dañino y la respuesta del modelo útil, que proporciona información de hacking a una persona malintencionada.
Después, los autores eligen uno de los 16 principios y piden al modelo que evalúe su respuesta anterior añadiendo lo siguiente:
Fuente: paper original
El principio pide al modelo que evalúe por sí mismo si su respuesta es inocua:
Fuente: paper original
Guiado por el principio, puede afirmar que acceder sin autorización al wifi de otra persona no es ético. Los autores le piden entonces revisar su respuesta añadiendo:
Fuente: paper original
La respuesta revisada del modelo es:
Fuente: paper original
Fase de aprendizaje por refuerzo
Fase de refuerzo de Constitutional AI | Fuente
- El modelo útil genera respuestas ante prompts de red teaming que buscan provocar muestras dañinas.
- Las respuestas pasan por un ciclo de mejora que usa los principios constitucionales para autoevaluarlas y ajustarlas.
- Esas salidas sirven para refinar el modelo de preferencias, mejorando su capacidad para favorecer respuestas alineadas con la constitución.
- El modelo de preferencias refinado se combina con SL-CAI para realizar más aprendizaje por refuerzo.
- El resultado es un modelo RL-CAI final, más capaz de generar respuestas seguras, éticas y útiles incluso ante peticiones complejas o potencialmente dañinas.
Retos de Constitutional AI
Una limitación evidente es que la «constitución» del modelo la diseñan personas. Por tanto, sus reglas fundamentales pueden introducir sesgos de manera involuntaria.
Créditos: Anthropic
Los autores señalan que no hubo demasiado rigor científico al elegir los principios ni al decidir cómo presentarlos al modelo de lenguaje grande (LLM). Es, por tanto, otro ámbito de investigación abierto.
¡Gracias por leer! Si te ha gustado el artículo, puedes dejar hasta 50 aplausos y seguirme en Medium para estar al día de las próximas publicaciones.
Logo de LatinX in AI (LXAI)
¿Te identificas como Latinx y trabajas en inteligencia artificial, o conoces a alguien que lo haga?
- Únete al directorio y al foro: https://forum.latinxinai.org/
- Puedes escribir en LatinX in AI contactando en publication@latinxinai.org.
- Más información en http://www.latinxinai.org/.
No olvides dejar un 👏 para apoyar a la comunidad.