{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.78125, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.5879646396264434, "epoch": 0.0390625, "grad_norm": 2.078125, "learning_rate": 3.828125000000001e-06, "loss": 0.5608741760253906, "mean_token_accuracy": 0.8732133361697197, "num_tokens": 309908.0, "step": 50 }, { "entropy": 0.09950160900130868, "epoch": 0.078125, "grad_norm": 2.296875, "learning_rate": 7.734375e-06, "loss": 0.08675869941711425, "mean_token_accuracy": 0.9764643028378487, "num_tokens": 618662.0, "step": 100 }, { "entropy": 0.06861632030457258, "epoch": 0.1171875, "grad_norm": 0.97265625, "learning_rate": 1.1640625000000002e-05, "loss": 0.059808659553527835, "mean_token_accuracy": 0.9829691171646118, "num_tokens": 923343.0, "step": 150 }, { "entropy": 0.06371763135306537, "epoch": 0.15625, "grad_norm": 1.125, "learning_rate": 1.5546875e-05, "loss": 0.05767580032348633, "mean_token_accuracy": 0.9834094086289406, "num_tokens": 1231860.0, "step": 200 }, { "entropy": 0.05956988543272018, "epoch": 0.1953125, "grad_norm": 1.1796875, "learning_rate": 1.9453125e-05, "loss": 0.052296199798583985, "mean_token_accuracy": 0.9851513150334358, "num_tokens": 1539428.0, "step": 250 }, { "entropy": 0.06213963699527085, "epoch": 0.234375, "grad_norm": 2.515625, "learning_rate": 1.9626736111111114e-05, "loss": 0.057163243293762205, "mean_token_accuracy": 0.9842589551210403, "num_tokens": 1844184.0, "step": 300 }, { "entropy": 0.051620940826833245, "epoch": 0.2734375, "grad_norm": 0.6015625, "learning_rate": 1.9192708333333335e-05, "loss": 0.04214866161346435, "mean_token_accuracy": 0.9875012004375457, "num_tokens": 2145404.0, "step": 350 }, { "entropy": 0.032940625557675955, "epoch": 0.3125, "grad_norm": 1.3046875, "learning_rate": 1.8758680555555557e-05, "loss": 0.0279494047164917, "mean_token_accuracy": 0.9905313903093338, "num_tokens": 2454513.0, "step": 400 }, { "entropy": 0.03187832637690008, "epoch": 0.3515625, "grad_norm": 0.130859375, "learning_rate": 1.8324652777777778e-05, "loss": 0.024850430488586425, "mean_token_accuracy": 0.9914047086238861, "num_tokens": 2763494.0, "step": 450 }, { "entropy": 0.029858413645997645, "epoch": 0.390625, "grad_norm": 0.279296875, "learning_rate": 1.7890625000000003e-05, "loss": 0.022111225128173827, "mean_token_accuracy": 0.9919667416810989, "num_tokens": 3070032.0, "step": 500 }, { "entropy": 0.032282271897420285, "epoch": 0.4296875, "grad_norm": 0.099609375, "learning_rate": 1.7456597222222224e-05, "loss": 0.024263689517974852, "mean_token_accuracy": 0.9916365548968316, "num_tokens": 3371923.0, "step": 550 }, { "entropy": 0.02768919712398201, "epoch": 0.46875, "grad_norm": 0.154296875, "learning_rate": 1.7022569444444446e-05, "loss": 0.02068368673324585, "mean_token_accuracy": 0.9922330856323243, "num_tokens": 3681052.0, "step": 600 }, { "entropy": 0.027916706460528077, "epoch": 0.5078125, "grad_norm": 0.146484375, "learning_rate": 1.6588541666666667e-05, "loss": 0.02017390251159668, "mean_token_accuracy": 0.9925840869545937, "num_tokens": 3985154.0, "step": 650 }, { "entropy": 0.024339500861242414, "epoch": 0.546875, "grad_norm": 0.09521484375, "learning_rate": 1.615451388888889e-05, "loss": 0.017752493619918822, "mean_token_accuracy": 0.992968330681324, "num_tokens": 4294960.0, "step": 700 }, { "entropy": 0.02500485216733068, "epoch": 0.5859375, "grad_norm": 0.08837890625, "learning_rate": 1.5720486111111114e-05, "loss": 0.018282731771469118, "mean_token_accuracy": 0.9928615567088127, "num_tokens": 4596846.0, "step": 750 }, { "entropy": 0.023879703185521066, "epoch": 0.625, "grad_norm": 0.158203125, "learning_rate": 1.5286458333333335e-05, "loss": 0.017627782821655273, "mean_token_accuracy": 0.9931773543357849, "num_tokens": 4904237.0, "step": 800 }, { "entropy": 0.02569641772657633, "epoch": 0.6640625, "grad_norm": 0.09765625, "learning_rate": 1.4852430555555556e-05, "loss": 0.01919528007507324, "mean_token_accuracy": 0.9929538157582283, "num_tokens": 5205258.0, "step": 850 }, { "entropy": 0.02546143492218107, "epoch": 0.703125, "grad_norm": 0.1162109375, "learning_rate": 1.4418402777777778e-05, "loss": 0.018223344087600707, "mean_token_accuracy": 0.9930938303470611, "num_tokens": 5511048.0, "step": 900 }, { "entropy": 0.023580400524660945, "epoch": 0.7421875, "grad_norm": 0.1611328125, "learning_rate": 1.3984375000000001e-05, "loss": 0.01719343423843384, "mean_token_accuracy": 0.9934566602110863, "num_tokens": 5824149.0, "step": 950 }, { "entropy": 0.022929171579889954, "epoch": 0.78125, "grad_norm": 0.19921875, "learning_rate": 1.3550347222222224e-05, "loss": 0.016624774932861328, "mean_token_accuracy": 0.9935434520244598, "num_tokens": 6133395.0, "step": 1000 } ], "logging_steps": 50, "max_steps": 2560, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.885719471186084e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }