Skip to content

Commit 11a8e5f

Browse files
Jacklanchantin/fix online dpo rm args (#1233)
* add new args for reward_handler.create * add qwen25_3b * increase max seq len * revert yaml
1 parent 69351e3 commit 11a8e5f

1 file changed

Lines changed: 3 additions & 0 deletions

File tree

src/fairseq2/recipes/lm/_online_finetune/_online_dpo.py

Lines changed: 3 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -456,10 +456,13 @@ def create(
456456
vllm_reward_model = vllm_actors.get(config.vllm_reward_model_actor_name, None)
457457
reward_registry = self._context.get_registry(VLLMOutputRewardHandler)
458458
reward_handler = reward_registry.get(config.reward.name)
459+
reward_name = config.reward.name
459460
reward = reward_handler.create(
460461
reward_model=vllm_reward_model,
462+
reward_name=reward_name,
461463
reward_config=config.reward.config,
462464
gangs=gangs,
465+
context=self._context,
463466
)
464467

465468
# TODO: decide converter as part of the model handler

0 commit comments

Comments
 (0)