{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 20, "global_step": 45, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.46982616782188413, "epoch": 0.1111111111111111, "grad_norm": 1.9415351152420044, "learning_rate": 0.00023999999999999998, "loss": 1.166135025024414, "mean_token_accuracy": 0.8076520800590515, "num_tokens": 59002.0, "step": 5 }, { "entropy": 0.681049507856369, "epoch": 0.2222222222222222, "grad_norm": 0.8071348071098328, "learning_rate": 0.00029929974520764727, "loss": 0.7030046463012696, "mean_token_accuracy": 0.849864411354065, "num_tokens": 120432.0, "step": 10 }, { "entropy": 0.9322404026985168, "epoch": 0.3333333333333333, "grad_norm": 0.6664227247238159, "learning_rate": 0.0002964661618243908, "loss": 0.878734016418457, "mean_token_accuracy": 0.8135401248931885, "num_tokens": 179678.0, "step": 15 }, { "entropy": 0.8074370503425599, "epoch": 0.4444444444444444, "grad_norm": 0.6451402306556702, "learning_rate": 0.0002914967719886614, "loss": 0.8701633453369141, "mean_token_accuracy": 0.8204897165298461, "num_tokens": 240600.0, "step": 20 }, { "epoch": 0.4444444444444444, "eval_entropy": 0.8143169482549032, "eval_loss": 0.924848735332489, "eval_mean_token_accuracy": 0.803371528784434, "eval_num_tokens": 240600.0, "eval_runtime": 1.6201, "eval_samples_per_second": 45.676, "eval_steps_per_second": 1.852, "step": 20 }, { "entropy": 0.7912694752216339, "epoch": 0.5555555555555556, "grad_norm": 0.4144524037837982, "learning_rate": 0.0002844640405943555, "loss": 0.8696941375732422, "mean_token_accuracy": 0.8263819813728333, "num_tokens": 301638.0, "step": 25 }, { "entropy": 0.9237359523773193, "epoch": 0.6666666666666666, "grad_norm": 0.5862515568733215, "learning_rate": 0.00027547052070153396, "loss": 0.9361928939819336, "mean_token_accuracy": 0.8028241634368897, "num_tokens": 359243.0, "step": 30 }, { "entropy": 0.6837044417858124, "epoch": 0.7777777777777778, "grad_norm": 0.4594927728176117, "learning_rate": 0.0002646473580818772, "loss": 0.6992801666259766, "mean_token_accuracy": 0.8513208270072937, "num_tokens": 417098.0, "step": 35 }, { "entropy": 0.8795680403709412, "epoch": 0.8888888888888888, "grad_norm": 0.5710228681564331, "learning_rate": 0.00025215237881801955, "loss": 0.9085055351257324, "mean_token_accuracy": 0.8098101854324341, "num_tokens": 480008.0, "step": 40 }, { "epoch": 0.8888888888888888, "eval_entropy": 0.8618650635083517, "eval_loss": 0.9124361872673035, "eval_mean_token_accuracy": 0.8028692404429117, "eval_num_tokens": 480008.0, "eval_runtime": 1.6251, "eval_samples_per_second": 45.535, "eval_steps_per_second": 1.846, "step": 40 }, { "entropy": 0.8452938675880433, "epoch": 1.0, "grad_norm": 0.789717972278595, "learning_rate": 0.00023816778784387094, "loss": 0.8828925132751465, "mean_token_accuracy": 0.8208261251449585, "num_tokens": 530794.0, "step": 45 } ], "logging_steps": 5, "max_steps": 135, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1952299008000000.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }