Files
llama32-3b-redo-dpo_simple/eval_results.json
ModelHub XC 51c9b49e18 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/llama32-3b-redo-dpo_simple
Source: Original Platform
2026-08-29 12:08:17 +08:00

21 lines
868 B
JSON

{
"epoch": 1.0,
"eval_logits/chosen": -1.3287253379821777,
"eval_logits/rejected": -1.3337767124176025,
"eval_logps/chosen": -316.3905944824219,
"eval_logps/rejected": -254.8103485107422,
"eval_loss": 0.4671759009361267,
"eval_metrics/advantage_var": 125.51482391357422,
"eval_rewards/accuracies": 0.7835859060287476,
"eval_rewards/chosen": 1.0432024002075195,
"eval_rewards/margins": 1.0373461246490479,
"eval_rewards/rejected": 0.005856274161487818,
"eval_runtime": 273.8577,
"eval_samples_per_second": 14.438,
"eval_stability/repetition_rate_mean": 0.8705078363418579,
"eval_stability/response_length_mean": 512.0,
"eval_stability/response_length_std": 0.0,
"eval_stability/response_length_var": 0.0,
"eval_stability/token_entropy_mean": 1.601953148841858,
"eval_steps_per_second": 1.808
}