{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 10, "global_step": 45, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.5051268041133881, "epoch": 0.1111111111111111, "grad_norm": 1.7442580461502075, "learning_rate": 0.0002984015052112665, "loss": 1.0908665657043457, "mean_token_accuracy": 0.8142835974693299, "num_tokens": 59002.0, "step": 5 }, { "entropy": 0.7225139260292053, "epoch": 0.2222222222222222, "grad_norm": 0.7206196784973145, "learning_rate": 0.0002808074112215711, "loss": 0.6919548034667968, "mean_token_accuracy": 0.8514000058174134, "num_tokens": 120432.0, "step": 10 }, { "epoch": 0.2222222222222222, "eval_entropy": 0.9578993916511536, "eval_loss": 0.9403628706932068, "eval_mean_token_accuracy": 0.8023552894592285, "eval_num_tokens": 120432.0, "eval_runtime": 1.6133, "eval_samples_per_second": 45.869, "eval_steps_per_second": 1.86, "step": 10 }, { "entropy": 0.8998202800750732, "epoch": 0.3333333333333333, "grad_norm": 0.6158784031867981, "learning_rate": 0.00024595095323383365, "loss": 0.8696078300476074, "mean_token_accuracy": 0.8144582986831665, "num_tokens": 179678.0, "step": 15 }, { "entropy": 0.7956753373146057, "epoch": 0.4444444444444444, "grad_norm": 0.638497531414032, "learning_rate": 0.00019843206071571692, "loss": 0.8670864105224609, "mean_token_accuracy": 0.8208897352218628, "num_tokens": 240600.0, "step": 20 }, { "epoch": 0.4444444444444444, "eval_entropy": 0.8266730904579163, "eval_loss": 0.9242745637893677, "eval_mean_token_accuracy": 0.803473949432373, "eval_num_tokens": 240600.0, "eval_runtime": 1.6168, "eval_samples_per_second": 45.77, "eval_steps_per_second": 1.856, "step": 20 }, { "entropy": 0.7963908970355987, "epoch": 0.5555555555555556, "grad_norm": 0.42324671149253845, "learning_rate": 0.00014452169654135115, "loss": 0.8695890426635742, "mean_token_accuracy": 0.8264959454536438, "num_tokens": 301638.0, "step": 25 }, { "entropy": 0.9203879475593567, "epoch": 0.6666666666666666, "grad_norm": 0.6087479591369629, "learning_rate": 9.133429192647661e-05, "loss": 0.9359363555908203, "mean_token_accuracy": 0.8043835282325744, "num_tokens": 359243.0, "step": 30 }, { "epoch": 0.6666666666666666, "eval_entropy": 0.861892561117808, "eval_loss": 0.918761670589447, "eval_mean_token_accuracy": 0.8063527544339498, "eval_num_tokens": 359243.0, "eval_runtime": 1.6289, "eval_samples_per_second": 45.43, "eval_steps_per_second": 1.842, "step": 30 }, { "entropy": 0.6894854545593262, "epoch": 0.7777777777777778, "grad_norm": 0.48022472858428955, "learning_rate": 4.58888707169049e-05, "loss": 0.6996908187866211, "mean_token_accuracy": 0.849899160861969, "num_tokens": 417098.0, "step": 35 }, { "entropy": 0.8869106888771057, "epoch": 0.8888888888888888, "grad_norm": 0.5962172746658325, "learning_rate": 1.4182764376028006e-05, "loss": 0.9062419891357422, "mean_token_accuracy": 0.8095215201377869, "num_tokens": 480008.0, "step": 40 }, { "epoch": 0.8888888888888888, "eval_entropy": 0.8640047709147135, "eval_loss": 0.9166465997695923, "eval_mean_token_accuracy": 0.8074178695678711, "eval_num_tokens": 480008.0, "eval_runtime": 1.6231, "eval_samples_per_second": 45.593, "eval_steps_per_second": 1.848, "step": 40 }, { "entropy": 0.8551887631416321, "epoch": 1.0, "grad_norm": 0.8982498049736023, "learning_rate": 4.0015745046725336e-07, "loss": 0.8875165939331054, "mean_token_accuracy": 0.8184282779693604, "num_tokens": 530794.0, "step": 45 }, { "epoch": 1.0, "eval_entropy": 0.8636427720387777, "eval_loss": 0.9162904620170593, "eval_mean_token_accuracy": 0.8047811388969421, "eval_num_tokens": 530794.0, "eval_runtime": 1.6244, "eval_samples_per_second": 45.555, "eval_steps_per_second": 1.847, "step": 45 } ], "logging_steps": 5, "max_steps": 45, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1952299008000000.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }