DyLam — Ponderação Dinâmica de Recompensas para RL
AAMAS 2025Problema
Tarefas de aprendizado por reforço multiobjetivo precisam de vários componentes de recompensa ponderados entre si. Pesos fixos, definidos uma vez antes do treino, tendem a produzir políticas instáveis ou subótimas conforme o treino avança.
O que construí
- Um framework que reponderá dinamicamente os componentes de recompensa durante o treino, em vez de fixá-los previamente
- Implementação em PyTorch, rastreada e comparada via Weights & Biases
- Avaliado em Gymnasium/MuJoCo, MO-Gymnasium e no simulador de futebol de robôs rSoccer-gym, próprio da equipe
Resultado
Revisado por pares e publicado na AAMAS 2025, um dos principais veículos de sistemas multiagente.