{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 20, "global_step": 90, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.46982616782188413, "epoch": 0.1111111111111111, "grad_norm": 1.9415351152420044, "learning_rate": 0.00023999999999999998, "loss": 1.166135025024414, "mean_token_accuracy": 0.8076520800590515, "num_tokens": 59002.0, "step": 5 }, { "entropy": 0.681049507856369, "epoch": 0.2222222222222222, "grad_norm": 0.8071348071098328, "learning_rate": 0.00029929974520764727, "loss": 0.7030046463012696, "mean_token_accuracy": 0.849864411354065, "num_tokens": 120432.0, "step": 10 }, { "entropy": 0.9322404026985168, "epoch": 0.3333333333333333, "grad_norm": 0.6664227247238159, "learning_rate": 0.0002964661618243908, "loss": 0.878734016418457, "mean_token_accuracy": 0.8135401248931885, "num_tokens": 179678.0, "step": 15 }, { "entropy": 0.8074370503425599, "epoch": 0.4444444444444444, "grad_norm": 0.6451402306556702, "learning_rate": 0.0002914967719886614, "loss": 0.8701633453369141, "mean_token_accuracy": 0.8204897165298461, "num_tokens": 240600.0, "step": 20 }, { "epoch": 0.4444444444444444, "eval_entropy": 0.8143169482549032, "eval_loss": 0.924848735332489, "eval_mean_token_accuracy": 0.803371528784434, "eval_num_tokens": 240600.0, "eval_runtime": 1.6201, "eval_samples_per_second": 45.676, "eval_steps_per_second": 1.852, "step": 20 }, { "entropy": 0.7912694752216339, "epoch": 0.5555555555555556, "grad_norm": 0.4144524037837982, "learning_rate": 0.0002844640405943555, "loss": 0.8696941375732422, "mean_token_accuracy": 0.8263819813728333, "num_tokens": 301638.0, "step": 25 }, { "entropy": 0.9237359523773193, "epoch": 0.6666666666666666, "grad_norm": 0.5862515568733215, "learning_rate": 0.00027547052070153396, "loss": 0.9361928939819336, "mean_token_accuracy": 0.8028241634368897, "num_tokens": 359243.0, "step": 30 }, { "entropy": 0.6837044417858124, "epoch": 0.7777777777777778, "grad_norm": 0.4594927728176117, "learning_rate": 0.0002646473580818772, "loss": 0.6992801666259766, "mean_token_accuracy": 0.8513208270072937, "num_tokens": 417098.0, "step": 35 }, { "entropy": 0.8795680403709412, "epoch": 0.8888888888888888, "grad_norm": 0.5710228681564331, "learning_rate": 0.00025215237881801955, "loss": 0.9085055351257324, "mean_token_accuracy": 0.8098101854324341, "num_tokens": 480008.0, "step": 40 }, { "epoch": 0.8888888888888888, "eval_entropy": 0.8618650635083517, "eval_loss": 0.9124361872673035, "eval_mean_token_accuracy": 0.8028692404429117, "eval_num_tokens": 480008.0, "eval_runtime": 1.6251, "eval_samples_per_second": 45.535, "eval_steps_per_second": 1.846, "step": 40 }, { "entropy": 0.8452938675880433, "epoch": 1.0, "grad_norm": 0.789717972278595, "learning_rate": 0.00023816778784387094, "loss": 0.8828925132751465, "mean_token_accuracy": 0.8208261251449585, "num_tokens": 530794.0, "step": 45 }, { "entropy": 0.5805854141712189, "epoch": 1.1111111111111112, "grad_norm": 0.4138790965080261, "learning_rate": 0.00022289751198639087, "loss": 0.5360542297363281, "mean_token_accuracy": 0.8808212757110596, "num_tokens": 589773.0, "step": 50 }, { "entropy": 0.8660945177078248, "epoch": 1.2222222222222223, "grad_norm": 0.4917871356010437, "learning_rate": 0.00020656422625324805, "loss": 0.8303131103515625, "mean_token_accuracy": 0.8197528839111328, "num_tokens": 644861.0, "step": 55 }, { "entropy": 0.5908387929201127, "epoch": 1.3333333333333333, "grad_norm": 0.5149257779121399, "learning_rate": 0.00018940610672978802, "loss": 0.5536936283111572, "mean_token_accuracy": 0.8759726524353028, "num_tokens": 707064.0, "step": 60 }, { "epoch": 1.3333333333333333, "eval_entropy": 0.7562275131543478, "eval_loss": 0.9295161366462708, "eval_mean_token_accuracy": 0.8002562522888184, "eval_num_tokens": 707064.0, "eval_runtime": 1.6273, "eval_samples_per_second": 45.475, "eval_steps_per_second": 1.844, "step": 60 }, { "entropy": 0.7860998153686524, "epoch": 1.4444444444444444, "grad_norm": 0.6012740731239319, "learning_rate": 0.00017167335743538317, "loss": 0.7982378482818604, "mean_token_accuracy": 0.8309973835945129, "num_tokens": 763959.0, "step": 65 }, { "entropy": 0.6057170808315278, "epoch": 1.5555555555555556, "grad_norm": 0.7193827629089355, "learning_rate": 0.00015362456178541982, "loss": 0.6322322368621827, "mean_token_accuracy": 0.8604895114898682, "num_tokens": 826139.0, "step": 70 }, { "entropy": 0.8781150817871094, "epoch": 1.6666666666666665, "grad_norm": 0.5556202530860901, "learning_rate": 0.00013552291186282273, "loss": 0.8648699760437012, "mean_token_accuracy": 0.8099217295646668, "num_tokens": 883964.0, "step": 75 }, { "entropy": 0.7820337891578675, "epoch": 1.7777777777777777, "grad_norm": 0.626190721988678, "learning_rate": 0.00011763237048482908, "loss": 0.7500524520874023, "mean_token_accuracy": 0.8313877940177917, "num_tokens": 942825.0, "step": 80 }, { "epoch": 1.7777777777777777, "eval_entropy": 0.7708820303281149, "eval_loss": 0.9428374767303467, "eval_mean_token_accuracy": 0.7990738352139791, "eval_num_tokens": 942825.0, "eval_runtime": 1.6267, "eval_samples_per_second": 45.49, "eval_steps_per_second": 1.844, "step": 80 }, { "entropy": 0.6434245944023133, "epoch": 1.8888888888888888, "grad_norm": 0.7037157416343689, "learning_rate": 0.00010021382203072075, "loss": 0.6138159275054932, "mean_token_accuracy": 0.8665528893470764, "num_tokens": 1005474.0, "step": 85 }, { "entropy": 0.44103629887104034, "epoch": 2.0, "grad_norm": 0.5344287753105164, "learning_rate": 8.352126816011381e-05, "loss": 0.441878604888916, "mean_token_accuracy": 0.9036641597747803, "num_tokens": 1061588.0, "step": 90 } ], "logging_steps": 5, "max_steps": 135, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3901053911040000.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }