{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 258, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3396112367510795, "epoch": 0.1171303074670571, "grad_norm": 0.83203125, "learning_rate": 0.00019999210442038162, "loss": 1.5911, "mean_token_accuracy": 0.6371529325842857, "num_tokens": 81104.0, "step": 10 }, { "entropy": 1.1428312733769417, "epoch": 0.2342606149341142, "grad_norm": 0.578125, "learning_rate": 0.00019904614256966512, "loss": 1.1178, "mean_token_accuracy": 0.7238687098026275, "num_tokens": 162974.0, "step": 20 }, { "entropy": 0.8962877839803696, "epoch": 0.3513909224011713, "grad_norm": 0.478515625, "learning_rate": 0.0001965381638833274, "loss": 0.9277, "mean_token_accuracy": 0.7669008579105139, "num_tokens": 244811.0, "step": 30 }, { "entropy": 0.9452402792870999, "epoch": 0.4685212298682284, "grad_norm": 0.421875, "learning_rate": 0.0001925077206834458, "loss": 0.9307, "mean_token_accuracy": 0.761869502440095, "num_tokens": 326663.0, "step": 40 }, { "entropy": 0.885918003693223, "epoch": 0.5856515373352855, "grad_norm": 0.400390625, "learning_rate": 0.0001870183754669526, "loss": 0.9136, "mean_token_accuracy": 0.7613564830273389, "num_tokens": 408546.0, "step": 50 }, { "entropy": 0.7956090953201056, "epoch": 0.7027818448023426, "grad_norm": 0.35546875, "learning_rate": 0.00018015669848708767, "loss": 0.7743, "mean_token_accuracy": 0.7908696968108415, "num_tokens": 490427.0, "step": 60 }, { "entropy": 0.7252638831734657, "epoch": 0.8199121522693997, "grad_norm": 0.44140625, "learning_rate": 0.0001720309024887907, "loss": 0.7452, "mean_token_accuracy": 0.7986918680369854, "num_tokens": 572268.0, "step": 70 }, { "entropy": 0.8875785615295172, "epoch": 0.9370424597364568, "grad_norm": 0.3359375, "learning_rate": 0.00016276913612907007, "loss": 0.8771, "mean_token_accuracy": 0.7722796119749546, "num_tokens": 654069.0, "step": 80 }, { "entropy": 0.7577637726068497, "epoch": 1.0468521229868228, "grad_norm": 0.318359375, "learning_rate": 0.0001525174629961296, "loss": 0.735, "mean_token_accuracy": 0.7980754868189494, "num_tokens": 730754.0, "step": 90 }, { "entropy": 0.8036635374650359, "epoch": 1.16398243045388, "grad_norm": 0.375, "learning_rate": 0.00014143755809932845, "loss": 0.8076, "mean_token_accuracy": 0.7897886544466018, "num_tokens": 812566.0, "step": 100 }, { "entropy": 0.8438609030097723, "epoch": 1.281112737920937, "grad_norm": 0.33203125, "learning_rate": 0.0001297041581577035, "loss": 0.8318, "mean_token_accuracy": 0.7828883446753025, "num_tokens": 893688.0, "step": 110 }, { "entropy": 0.7181106580421328, "epoch": 1.3982430453879942, "grad_norm": 0.404296875, "learning_rate": 0.00011750230589752762, "loss": 0.7207, "mean_token_accuracy": 0.8055280044674873, "num_tokens": 975564.0, "step": 120 }, { "entropy": 0.7229301311075688, "epoch": 1.5153733528550513, "grad_norm": 0.388671875, "learning_rate": 0.00010502443181797697, "loss": 0.7249, "mean_token_accuracy": 0.8056504145264626, "num_tokens": 1057403.0, "step": 130 }, { "entropy": 0.7823872465640307, "epoch": 1.6325036603221084, "grad_norm": 0.36328125, "learning_rate": 9.246731944720675e-05, "loss": 0.7791, "mean_token_accuracy": 0.7945993095636368, "num_tokens": 1139268.0, "step": 140 }, { "entropy": 0.6786214027553796, "epoch": 1.7496339677891655, "grad_norm": 0.39453125, "learning_rate": 8.002900194855932e-05, "loss": 0.6803, "mean_token_accuracy": 0.8125956118106842, "num_tokens": 1221128.0, "step": 150 }, { "entropy": 0.7029102340340614, "epoch": 1.8667642752562226, "grad_norm": 0.451171875, "learning_rate": 6.790563901927907e-05, "loss": 0.6941, "mean_token_accuracy": 0.8080258596688509, "num_tokens": 1302883.0, "step": 160 }, { "entropy": 0.8408648435026407, "epoch": 1.9838945827232797, "grad_norm": 0.421875, "learning_rate": 5.6288423334906735e-05, "loss": 0.843, "mean_token_accuracy": 0.7804605267941952, "num_tokens": 1384758.0, "step": 170 }, { "entropy": 0.7994472912947337, "epoch": 2.0937042459736457, "grad_norm": 0.3671875, "learning_rate": 4.5360565326573104e-05, "loss": 0.7804, "mean_token_accuracy": 0.7989432060718537, "num_tokens": 1461478.0, "step": 180 }, { "entropy": 0.7261181980371475, "epoch": 2.210834553440703, "grad_norm": 0.380859375, "learning_rate": 3.52944038430556e-05, "loss": 0.7032, "mean_token_accuracy": 0.8093580298125744, "num_tokens": 1543336.0, "step": 190 }, { "entropy": 0.6980411611497402, "epoch": 2.32796486090776, "grad_norm": 0.41015625, "learning_rate": 2.624868826418262e-05, "loss": 0.7014, "mean_token_accuracy": 0.8104535348713398, "num_tokens": 1625196.0, "step": 200 }, { "entropy": 0.6276400487869978, "epoch": 2.445095168374817, "grad_norm": 0.376953125, "learning_rate": 1.8366074928281607e-05, "loss": 0.63, "mean_token_accuracy": 0.8211923144757748, "num_tokens": 1707105.0, "step": 210 }, { "entropy": 0.7523287607356905, "epoch": 2.562225475841874, "grad_norm": 0.392578125, "learning_rate": 1.1770877356504683e-05, "loss": 0.7501, "mean_token_accuracy": 0.7998858217149973, "num_tokens": 1788910.0, "step": 220 }, { "entropy": 0.7270868588238955, "epoch": 2.679355783308931, "grad_norm": 0.3671875, "learning_rate": 6.5671057543387985e-06, "loss": 0.7306, "mean_token_accuracy": 0.8045763105154038, "num_tokens": 1869982.0, "step": 230 }, { "entropy": 0.64420210942626, "epoch": 2.7964860907759883, "grad_norm": 0.416015625, "learning_rate": 2.836826708532603e-06, "loss": 0.6385, "mean_token_accuracy": 0.8231038711965084, "num_tokens": 1951891.0, "step": 240 }, { "entropy": 0.7004209227859974, "epoch": 2.9136163982430454, "grad_norm": 0.41015625, "learning_rate": 6.388689479991605e-07, "loss": 0.7025, "mean_token_accuracy": 0.8102728992700576, "num_tokens": 2033696.0, "step": 250 } ], "logging_steps": 10, "max_steps": 258, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5660925050880000.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }