{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.98876404494382, "eval_steps": 50, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.149812734082397, "grad_norm": 0.5950071811676025, "learning_rate": 0.00016363636363636366, "loss": 2.3793, "step": 10 }, { "epoch": 0.299625468164794, "grad_norm": 0.6472743153572083, "learning_rate": 0.00019912640693269752, "loss": 1.9763, "step": 20 }, { "epoch": 0.449438202247191, "grad_norm": 0.4513455033302307, "learning_rate": 0.00019560357815343577, "loss": 1.7276, "step": 30 }, { "epoch": 0.599250936329588, "grad_norm": 0.41116923093795776, "learning_rate": 0.00018947293298207635, "loss": 1.7337, "step": 40 }, { "epoch": 0.7490636704119851, "grad_norm": 0.516603410243988, "learning_rate": 0.00018090169943749476, "loss": 1.5853, "step": 50 }, { "epoch": 0.7490636704119851, "eval_loss": 1.577757716178894, "eval_runtime": 8.4577, "eval_samples_per_second": 6.976, "eval_steps_per_second": 1.774, "step": 50 }, { "epoch": 0.898876404494382, "grad_norm": 0.534030556678772, "learning_rate": 0.00017012367842724887, "loss": 1.59, "step": 60 }, { "epoch": 1.0449438202247192, "grad_norm": 0.40544188022613525, "learning_rate": 0.00015743286626829437, "loss": 1.5288, "step": 70 }, { "epoch": 1.1947565543071161, "grad_norm": 0.5801761746406555, "learning_rate": 0.00014317543523384928, "loss": 1.4823, "step": 80 }, { "epoch": 1.344569288389513, "grad_norm": 0.5626828670501709, "learning_rate": 0.00012774029087618446, "loss": 1.4503, "step": 90 }, { "epoch": 1.49438202247191, "grad_norm": 0.6915966272354126, "learning_rate": 0.00011154846369695863, "loss": 1.4354, "step": 100 }, { "epoch": 1.49438202247191, "eval_loss": 1.5176668167114258, "eval_runtime": 7.8374, "eval_samples_per_second": 7.528, "eval_steps_per_second": 1.914, "step": 100 }, { "epoch": 1.6441947565543071, "grad_norm": 0.6429805159568787, "learning_rate": 9.504162453267777e-05, "loss": 1.4173, "step": 110 }, { "epoch": 1.7940074906367043, "grad_norm": 0.5912101864814758, "learning_rate": 7.867003692562534e-05, "loss": 1.3651, "step": 120 }, { "epoch": 1.9438202247191012, "grad_norm": 0.6238114237785339, "learning_rate": 6.28802751081779e-05, "loss": 1.4081, "step": 130 }, { "epoch": 2.0898876404494384, "grad_norm": 0.5546865463256836, "learning_rate": 4.810304262187852e-05, "loss": 1.3884, "step": 140 }, { "epoch": 2.2397003745318353, "grad_norm": 0.7205243110656738, "learning_rate": 3.4741423847583134e-05, "loss": 1.1613, "step": 150 }, { "epoch": 2.2397003745318353, "eval_loss": 1.5284953117370605, "eval_runtime": 7.895, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.9, "step": 150 }, { "epoch": 2.3895131086142323, "grad_norm": 0.7052301168441772, "learning_rate": 2.315988891431412e-05, "loss": 1.2287, "step": 160 }, { "epoch": 2.539325842696629, "grad_norm": 0.8039580583572388, "learning_rate": 1.3674351904242611e-05, "loss": 1.2225, "step": 170 }, { "epoch": 2.689138576779026, "grad_norm": 0.8460856080055237, "learning_rate": 6.543553540053926e-06, "loss": 1.2547, "step": 180 }, { "epoch": 2.8389513108614235, "grad_norm": 0.869657039642334, "learning_rate": 1.9620034125190644e-06, "loss": 1.1826, "step": 190 }, { "epoch": 2.98876404494382, "grad_norm": 0.7707263827323914, "learning_rate": 5.467426590739511e-08, "loss": 1.1658, "step": 200 }, { "epoch": 2.98876404494382, "eval_loss": 1.527919888496399, "eval_runtime": 7.7439, "eval_samples_per_second": 7.619, "eval_steps_per_second": 1.937, "step": 200 } ], "logging_steps": 10, "max_steps": 201, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7623466959651840.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }