lmflow.pipeline.iterative_dpo_aligner#
Attributes#
Classes#
Module Contents#
- class lmflow.pipeline.iterative_dpo_aligner.IterativeDPOAligner(model_args: lmflow.args.ModelArguments, data_args: lmflow.args.DatasetArguments, aligner_args: lmflow.args.IterativeDPOAlignerArguments, ref_model_args: lmflow.args.ModelArguments, reward_model_args: lmflow.args.ModelArguments, **kwargs)[source]#
-
- align(dataset_list: list[lmflow.datasets.dataset.Dataset])[source]#