{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004, "grad_norm": 133.0, "learning_rate": 8.000000000000001e-07, "loss": 14.6589, "step": 10 }, { "epoch": 0.008, "grad_norm": 105.0, "learning_rate": 1.6000000000000001e-06, "loss": 14.6939, "step": 20 }, { "epoch": 0.012, "grad_norm": 147.0, "learning_rate": 2.4000000000000003e-06, "loss": 14.6547, "step": 30 }, { "epoch": 0.016, "grad_norm": 71.0, "learning_rate": 3.2000000000000003e-06, "loss": 14.3371, "step": 40 }, { "epoch": 0.02, "grad_norm": 50.25, "learning_rate": 4.000000000000001e-06, "loss": 14.3937, "step": 50 }, { "epoch": 0.024, "grad_norm": 48.0, "learning_rate": 4.800000000000001e-06, "loss": 14.1942, "step": 60 }, { "epoch": 0.028, "grad_norm": 53.0, "learning_rate": 5.600000000000001e-06, "loss": 14.1931, "step": 70 }, { "epoch": 0.032, "grad_norm": 32.25, "learning_rate": 6.4000000000000006e-06, "loss": 13.6957, "step": 80 }, { "epoch": 0.036, "grad_norm": 49.5, "learning_rate": 7.2000000000000005e-06, "loss": 13.77, "step": 90 }, { "epoch": 0.04, "grad_norm": 49.0, "learning_rate": 8.000000000000001e-06, "loss": 13.6821, "step": 100 }, { "epoch": 0.044, "grad_norm": 42.25, "learning_rate": 8.8e-06, "loss": 13.6035, "step": 110 }, { "epoch": 0.048, "grad_norm": 55.5, "learning_rate": 9.600000000000001e-06, "loss": 13.8774, "step": 120 }, { "epoch": 0.052, "grad_norm": 62.75, "learning_rate": 1.04e-05, "loss": 13.6259, "step": 130 }, { "epoch": 0.056, "grad_norm": 55.0, "learning_rate": 1.1200000000000001e-05, "loss": 13.4089, "step": 140 }, { "epoch": 0.06, "grad_norm": 65.5, "learning_rate": 1.2e-05, "loss": 13.6572, "step": 150 }, { "epoch": 0.064, "grad_norm": 68.0, "learning_rate": 1.2800000000000001e-05, "loss": 13.5695, "step": 160 }, { "epoch": 0.068, "grad_norm": 56.0, "learning_rate": 1.3600000000000002e-05, "loss": 13.5, "step": 170 }, { "epoch": 0.072, "grad_norm": 72.0, "learning_rate": 1.4400000000000001e-05, "loss": 13.5601, "step": 180 }, { "epoch": 0.076, "grad_norm": 87.0, "learning_rate": 1.5200000000000002e-05, "loss": 14.2029, "step": 190 }, { "epoch": 0.08, "grad_norm": 83.0, "learning_rate": 1.6000000000000003e-05, "loss": 14.2416, "step": 200 }, { "epoch": 0.084, "grad_norm": 81.5, "learning_rate": 1.6800000000000002e-05, "loss": 13.8197, "step": 210 }, { "epoch": 0.088, "grad_norm": 75.5, "learning_rate": 1.76e-05, "loss": 14.1598, "step": 220 }, { "epoch": 0.092, "grad_norm": 89.5, "learning_rate": 1.8400000000000003e-05, "loss": 14.1819, "step": 230 }, { "epoch": 0.096, "grad_norm": 76.5, "learning_rate": 1.9200000000000003e-05, "loss": 13.9713, "step": 240 }, { "epoch": 0.1, "grad_norm": 87.0, "learning_rate": 2e-05, "loss": 14.3763, "step": 250 }, { "epoch": 0.104, "grad_norm": 79.0, "learning_rate": 1.9999025240093045e-05, "loss": 14.4492, "step": 260 }, { "epoch": 0.108, "grad_norm": 84.5, "learning_rate": 1.9996101150403543e-05, "loss": 14.2794, "step": 270 }, { "epoch": 0.112, "grad_norm": 84.0, "learning_rate": 1.9991228300988586e-05, "loss": 14.0471, "step": 280 }, { "epoch": 0.116, "grad_norm": 75.0, "learning_rate": 1.9984407641819812e-05, "loss": 14.3031, "step": 290 }, { "epoch": 0.12, "grad_norm": 71.5, "learning_rate": 1.9975640502598243e-05, "loss": 13.8098, "step": 300 }, { "epoch": 0.124, "grad_norm": 70.5, "learning_rate": 1.9964928592495046e-05, "loss": 14.075, "step": 310 }, { "epoch": 0.128, "grad_norm": 63.0, "learning_rate": 1.9952273999818312e-05, "loss": 14.2647, "step": 320 }, { "epoch": 0.132, "grad_norm": 85.0, "learning_rate": 1.9937679191605964e-05, "loss": 13.6276, "step": 330 }, { "epoch": 0.136, "grad_norm": 47.25, "learning_rate": 1.9921147013144782e-05, "loss": 13.5483, "step": 340 }, { "epoch": 0.14, "grad_norm": 84.5, "learning_rate": 1.9902680687415704e-05, "loss": 13.8993, "step": 350 }, { "epoch": 0.144, "grad_norm": 77.0, "learning_rate": 1.988228381446553e-05, "loss": 13.4859, "step": 360 }, { "epoch": 0.148, "grad_norm": 71.5, "learning_rate": 1.985996037070505e-05, "loss": 13.8062, "step": 370 }, { "epoch": 0.152, "grad_norm": 69.0, "learning_rate": 1.983571470813386e-05, "loss": 13.5252, "step": 380 }, { "epoch": 0.156, "grad_norm": 51.5, "learning_rate": 1.9809551553491918e-05, "loss": 13.3325, "step": 390 }, { "epoch": 0.16, "grad_norm": 54.75, "learning_rate": 1.9781476007338058e-05, "loss": 13.4057, "step": 400 }, { "epoch": 0.164, "grad_norm": 54.25, "learning_rate": 1.9751493543055634e-05, "loss": 13.5621, "step": 410 }, { "epoch": 0.168, "grad_norm": 57.75, "learning_rate": 1.9719610005785466e-05, "loss": 13.4838, "step": 420 }, { "epoch": 0.172, "grad_norm": 67.0, "learning_rate": 1.9685831611286312e-05, "loss": 13.6975, "step": 430 }, { "epoch": 0.176, "grad_norm": 63.5, "learning_rate": 1.9650164944723116e-05, "loss": 13.6201, "step": 440 }, { "epoch": 0.18, "grad_norm": 57.5, "learning_rate": 1.961261695938319e-05, "loss": 13.2647, "step": 450 }, { "epoch": 0.184, "grad_norm": 57.75, "learning_rate": 1.9573194975320672e-05, "loss": 13.1013, "step": 460 }, { "epoch": 0.188, "grad_norm": 50.75, "learning_rate": 1.9531906677929472e-05, "loss": 13.357, "step": 470 }, { "epoch": 0.192, "grad_norm": 66.5, "learning_rate": 1.9488760116444966e-05, "loss": 13.4903, "step": 480 }, { "epoch": 0.196, "grad_norm": 57.0, "learning_rate": 1.944376370237481e-05, "loss": 13.4989, "step": 490 }, { "epoch": 0.2, "grad_norm": 35.0, "learning_rate": 1.9396926207859085e-05, "loss": 13.265, "step": 500 } ], "logging_steps": 10, "max_steps": 2500, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.5664155394048e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }