Categoría
Papers de alignment en español
2 artículos
PAPER · IA · RLHF
Hacking de recompensa en RLHF — Gao et al. (2023)
Traducción al español de 'Reward Hacking in RLHF' (Gao et al., 2023). Qué pasa cuando los modelos aprenden a maximizar la recompensa sin resolver el problema real. Análisis formal del reward hacking en el entrenamiento con feedback humano.
·1 minLeer →PAPER · IA · Anthropic
IA constitucional — Bai et al. (2022)
Traducción al español de 'Constitutional AI' (Bai et al., 2022). Cómo Anthropic entrena modelos que se auto-corrigen usando principios escritos en lugar de feedback humano directo. El método de alineación detrás de Claude, explicado en español.
·1 minLeer →