{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 7.0, "eval_steps": 500, "global_step": 140, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.25, "grad_norm": 6.958695468962432, "learning_rate": 1.1428571428571429e-05, "loss": 0.8727, "loss_nan_ranks": 0, "loss_rank_avg": 0.47663891315460205, "step": 5, "valid_targets_mean": 2538.0, "valid_targets_min": 960 }, { "epoch": 0.5, "grad_norm": 1.8207863318741868, "learning_rate": 2.5714285714285718e-05, "loss": 0.7493, "loss_nan_ranks": 0, "loss_rank_avg": 0.3401631712913513, "step": 10, "valid_targets_mean": 3047.4, "valid_targets_min": 881 }, { "epoch": 0.75, "grad_norm": 1.2285257783776453, "learning_rate": 4e-05, "loss": 0.6659, "loss_nan_ranks": 0, "loss_rank_avg": 0.4193618893623352, "step": 15, "valid_targets_mean": 3820.1, "valid_targets_min": 1000 }, { "epoch": 1.0, "grad_norm": 1.081996271850223, "learning_rate": 3.984478413200345e-05, "loss": 0.6289, "loss_nan_ranks": 0, "loss_rank_avg": 0.2763247489929199, "step": 20, "valid_targets_mean": 2313.0, "valid_targets_min": 1082 }, { "epoch": 1.25, "grad_norm": 0.9507456507977273, "learning_rate": 3.938154572458156e-05, "loss": 0.5711, "loss_nan_ranks": 0, "loss_rank_avg": 0.29192113876342773, "step": 25, "valid_targets_mean": 2284.5, "valid_targets_min": 1012 }, { "epoch": 1.5, "grad_norm": 0.7306775600487055, "learning_rate": 3.861747497288409e-05, "loss": 0.5306, "loss_nan_ranks": 0, "loss_rank_avg": 0.21971933543682098, "step": 30, "valid_targets_mean": 3120.9, "valid_targets_min": 1082 }, { "epoch": 1.75, "grad_norm": 0.8229696406571964, "learning_rate": 3.756443146740457e-05, "loss": 0.5133, "loss_nan_ranks": 0, "loss_rank_avg": 0.26939940452575684, "step": 35, "valid_targets_mean": 2751.1, "valid_targets_min": 906 }, { "epoch": 2.0, "grad_norm": 1.1425727207706642, "learning_rate": 3.623876011431714e-05, "loss": 0.5376, "loss_nan_ranks": 0, "loss_rank_avg": 0.22945210337638855, "step": 40, "valid_targets_mean": 2098.4, "valid_targets_min": 888 }, { "epoch": 2.25, "grad_norm": 0.8793107537574675, "learning_rate": 3.4661037436596526e-05, "loss": 0.4984, "loss_nan_ranks": 0, "loss_rank_avg": 0.2042250633239746, "step": 45, "valid_targets_mean": 1877.8, "valid_targets_min": 281 }, { "epoch": 2.5, "grad_norm": 0.9277264133426655, "learning_rate": 3.285575219373079e-05, "loss": 0.4675, "loss_nan_ranks": 0, "loss_rank_avg": 0.24294951558113098, "step": 50, "valid_targets_mean": 1935.4, "valid_targets_min": 1180 }, { "epoch": 2.75, "grad_norm": 0.8356405001375695, "learning_rate": 3.0850925277315193e-05, "loss": 0.4494, "loss_nan_ranks": 0, "loss_rank_avg": 0.2609573304653168, "step": 55, "valid_targets_mean": 3075.0, "valid_targets_min": 1023 }, { "epoch": 3.0, "grad_norm": 0.8994016375669758, "learning_rate": 2.8677674782351164e-05, "loss": 0.4392, "loss_nan_ranks": 0, "loss_rank_avg": 0.22629202902317047, "step": 60, "valid_targets_mean": 2096.5, "valid_targets_min": 906 }, { "epoch": 3.25, "grad_norm": 0.8719408186029495, "learning_rate": 2.6369733005033693e-05, "loss": 0.4353, "loss_nan_ranks": 0, "loss_rank_avg": 0.21587803959846497, "step": 65, "valid_targets_mean": 2585.2, "valid_targets_min": 1046 }, { "epoch": 3.5, "grad_norm": 0.8754944835267683, "learning_rate": 2.3962922863987956e-05, "loss": 0.4026, "loss_nan_ranks": 0, "loss_rank_avg": 0.19089141488075256, "step": 70, "valid_targets_mean": 1806.1, "valid_targets_min": 1012 }, { "epoch": 3.75, "grad_norm": 1.0148994845965762, "learning_rate": 2.149460187172849e-05, "loss": 0.4024, "loss_nan_ranks": 0, "loss_rank_avg": 0.21601556241512299, "step": 75, "valid_targets_mean": 2151.1, "valid_targets_min": 1249 }, { "epoch": 4.0, "grad_norm": 0.6801895926025394, "learning_rate": 1.9003082286786056e-05, "loss": 0.4011, "loss_nan_ranks": 0, "loss_rank_avg": 0.13709492981433868, "step": 80, "valid_targets_mean": 2535.5, "valid_targets_min": 1048 }, { "epoch": 4.25, "grad_norm": 0.8588772114134782, "learning_rate": 1.6527036446661396e-05, "loss": 0.4039, "loss_nan_ranks": 0, "loss_rank_avg": 0.21471670269966125, "step": 85, "valid_targets_mean": 2557.5, "valid_targets_min": 693 }, { "epoch": 4.5, "grad_norm": 0.9032798666713535, "learning_rate": 1.4104896511781916e-05, "loss": 0.3779, "loss_nan_ranks": 0, "loss_rank_avg": 0.20103931427001953, "step": 90, "valid_targets_mean": 2660.1, "valid_targets_min": 1229 }, { "epoch": 4.75, "grad_norm": 0.7615772109612865, "learning_rate": 1.1774257937387774e-05, "loss": 0.3646, "loss_nan_ranks": 0, "loss_rank_avg": 0.1381789743900299, "step": 95, "valid_targets_mean": 2183.5, "valid_targets_min": 1147 }, { "epoch": 5.0, "grad_norm": 0.9699370062930872, "learning_rate": 9.57129593241004e-06, "loss": 0.3588, "loss_nan_ranks": 0, "loss_rank_avg": 0.18376871943473816, "step": 100, "valid_targets_mean": 2001.8, "valid_targets_min": 903 }, { "epoch": 5.25, "grad_norm": 0.9079217183176301, "learning_rate": 7.530203962825331e-06, "loss": 0.3493, "loss_nan_ranks": 0, "loss_rank_avg": 0.19518150389194489, "step": 105, "valid_targets_mean": 3182.5, "valid_targets_min": 281 }, { "epoch": 5.5, "grad_norm": 1.0126584456406313, "learning_rate": 5.682663014805631e-06, "loss": 0.3352, "loss_nan_ranks": 0, "loss_rank_avg": 0.17489181458950043, "step": 110, "valid_targets_mean": 2201.6, "valid_targets_min": 1242 }, { "epoch": 5.75, "grad_norm": 1.0687509117646672, "learning_rate": 4.057349855541557e-06, "loss": 0.3566, "loss_nan_ranks": 0, "loss_rank_avg": 0.18527688086032867, "step": 115, "valid_targets_mean": 1757.4, "valid_targets_min": 896 }, { "epoch": 6.0, "grad_norm": 0.8424843756035632, "learning_rate": 2.679491924311226e-06, "loss": 0.3757, "loss_nan_ranks": 0, "loss_rank_avg": 0.17017652094364166, "step": 120, "valid_targets_mean": 2468.2, "valid_targets_min": 1479 }, { "epoch": 6.25, "grad_norm": 0.8190515884890711, "learning_rate": 1.5704757625918454e-06, "loss": 0.3467, "loss_nan_ranks": 0, "loss_rank_avg": 0.19655027985572815, "step": 125, "valid_targets_mean": 2659.4, "valid_targets_min": 1249 }, { "epoch": 6.5, "grad_norm": 0.7847715606973761, "learning_rate": 7.475150609997595e-07, "loss": 0.3642, "loss_nan_ranks": 0, "loss_rank_avg": 0.24304279685020447, "step": 130, "valid_targets_mean": 3288.0, "valid_targets_min": 888 }, { "epoch": 6.75, "grad_norm": 0.7443132050788007, "learning_rate": 2.2338347549742956e-07, "loss": 0.3527, "loss_nan_ranks": 0, "loss_rank_avg": 0.18210794031620026, "step": 135, "valid_targets_mean": 2576.2, "valid_targets_min": 693 }, { "epoch": 7.0, "grad_norm": 0.8807563056194639, "learning_rate": 6.216359983675091e-09, "loss": 0.3217, "loss_nan_ranks": 0, "loss_rank_avg": 0.16928507387638092, "step": 140, "valid_targets_mean": 2156.8, "valid_targets_min": 1031 }, { "epoch": 7.0, "loss_nan_ranks": 0, "loss_rank_avg": 0.16928507387638092, "step": 140, "total_flos": 2.2347755431133184e+16, "train_loss": 0.4597333984715598, "train_runtime": 702.992, "train_samples_per_second": 3.147, "train_steps_per_second": 0.199, "valid_targets_mean": 2156.8, "valid_targets_min": 1031 } ], "logging_steps": 5, "max_steps": 140, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 1500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.2347755431133184e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }