{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 653, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.015319800842589047, "grad_norm": 4.5, "learning_rate": 2.25e-07, "loss": 1.8881567001342774, "step": 10 }, { "epoch": 0.030639601685178094, "grad_norm": 12.9375, "learning_rate": 4.7499999999999995e-07, "loss": 2.0835521697998045, "step": 20 }, { "epoch": 0.04595940252776714, "grad_norm": 10.0, "learning_rate": 4.997506466835169e-07, "loss": 1.9390586853027343, "step": 30 }, { "epoch": 0.06127920337035619, "grad_norm": 11.6875, "learning_rate": 4.988893231902699e-07, "loss": 1.9236089706420898, "step": 40 }, { "epoch": 0.07659900421294523, "grad_norm": 13.375, "learning_rate": 4.974150717193653e-07, "loss": 1.716681671142578, "step": 50 }, { "epoch": 0.09191880505553428, "grad_norm": 7.65625, "learning_rate": 4.953315228402511e-07, "loss": 1.9944971084594727, "step": 60 }, { "epoch": 0.10723860589812333, "grad_norm": 9.25, "learning_rate": 4.926438076103162e-07, "loss": 1.9377096176147461, "step": 70 }, { "epoch": 0.12255840674071238, "grad_norm": 12.0625, "learning_rate": 4.893585449388785e-07, "loss": 2.0413049697875976, "step": 80 }, { "epoch": 0.1378782075833014, "grad_norm": 6.03125, "learning_rate": 4.854838252871096e-07, "loss": 1.8533470153808593, "step": 90 }, { "epoch": 0.15319800842589046, "grad_norm": 4.5625, "learning_rate": 4.810291907440381e-07, "loss": 1.641725730895996, "step": 100 }, { "epoch": 0.1685178092684795, "grad_norm": 5.84375, "learning_rate": 4.7600561152769787e-07, "loss": 1.8656742095947265, "step": 110 }, { "epoch": 0.18383761011106856, "grad_norm": 11.0, "learning_rate": 4.704254589692902e-07, "loss": 1.9227891921997071, "step": 120 }, { "epoch": 0.1991574109536576, "grad_norm": 7.03125, "learning_rate": 4.6430247504689124e-07, "loss": 1.9448070526123047, "step": 130 }, { "epoch": 0.21447721179624665, "grad_norm": 10.9375, "learning_rate": 4.576517385437314e-07, "loss": 1.8896455764770508, "step": 140 }, { "epoch": 0.2297970126388357, "grad_norm": 9.9375, "learning_rate": 4.504896279143888e-07, "loss": 1.874186897277832, "step": 150 }, { "epoch": 0.24511681348142475, "grad_norm": 6.09375, "learning_rate": 4.4283378095034244e-07, "loss": 1.7868270874023438, "step": 160 }, { "epoch": 0.26043661432401377, "grad_norm": 5.125, "learning_rate": 4.347030513442168e-07, "loss": 2.1282052993774414, "step": 170 }, { "epoch": 0.2757564151666028, "grad_norm": 5.9375, "learning_rate": 4.261174622596835e-07, "loss": 1.8293880462646483, "step": 180 }, { "epoch": 0.29107621600919187, "grad_norm": 12.3125, "learning_rate": 4.170981570213621e-07, "loss": 2.0162126541137697, "step": 190 }, { "epoch": 0.3063960168517809, "grad_norm": 17.25, "learning_rate": 4.076673470461537e-07, "loss": 1.958943748474121, "step": 200 }, { "epoch": 0.32171581769436997, "grad_norm": 12.9375, "learning_rate": 3.978482571442339e-07, "loss": 1.844751739501953, "step": 210 }, { "epoch": 0.337035618536959, "grad_norm": 5.9375, "learning_rate": 3.876650683244093e-07, "loss": 1.926915740966797, "step": 220 }, { "epoch": 0.35235541937954806, "grad_norm": 6.0, "learning_rate": 3.771428582446907e-07, "loss": 1.620564079284668, "step": 230 }, { "epoch": 0.3676752202221371, "grad_norm": 4.78125, "learning_rate": 3.663075394547285e-07, "loss": 1.9423002243041991, "step": 240 }, { "epoch": 0.38299502106472616, "grad_norm": 6.1875, "learning_rate": 3.551857955822014e-07, "loss": 1.8801351547241212, "step": 250 }, { "epoch": 0.3983148219073152, "grad_norm": 5.75, "learning_rate": 3.43805015620307e-07, "loss": 1.84176025390625, "step": 260 }, { "epoch": 0.41363462274990426, "grad_norm": 9.9375, "learning_rate": 3.3219322647818214e-07, "loss": 1.9039052963256835, "step": 270 }, { "epoch": 0.4289544235924933, "grad_norm": 7.71875, "learning_rate": 3.2037902396035824e-07, "loss": 2.1408451080322264, "step": 280 }, { "epoch": 0.44427422443508235, "grad_norm": 14.3125, "learning_rate": 3.0839150234522397e-07, "loss": 1.8292259216308593, "step": 290 }, { "epoch": 0.4595940252776714, "grad_norm": 13.75, "learning_rate": 2.9626018273592076e-07, "loss": 1.767644500732422, "step": 300 }, { "epoch": 0.47491382612026045, "grad_norm": 8.5625, "learning_rate": 2.840149403601165e-07, "loss": 2.0017181396484376, "step": 310 }, { "epoch": 0.4902336269628495, "grad_norm": 5.5625, "learning_rate": 2.716859309976941e-07, "loss": 1.9466903686523438, "step": 320 }, { "epoch": 0.5055534278054385, "grad_norm": 12.375, "learning_rate": 2.59303516717537e-07, "loss": 1.7483896255493163, "step": 330 }, { "epoch": 0.5208732286480275, "grad_norm": 5.6875, "learning_rate": 2.4689819110629636e-07, "loss": 1.6642837524414062, "step": 340 }, { "epoch": 0.5361930294906166, "grad_norm": 7.53125, "learning_rate": 2.3450050417327588e-07, "loss": 1.879330825805664, "step": 350 }, { "epoch": 0.5515128303332056, "grad_norm": 11.125, "learning_rate": 2.2214098711636751e-07, "loss": 1.950868797302246, "step": 360 }, { "epoch": 0.5668326311757947, "grad_norm": 9.375, "learning_rate": 2.0985007713431238e-07, "loss": 1.9813783645629883, "step": 370 }, { "epoch": 0.5821524320183837, "grad_norm": 6.96875, "learning_rate": 1.9765804247044975e-07, "loss": 1.7870925903320312, "step": 380 }, { "epoch": 0.5974722328609728, "grad_norm": 17.5, "learning_rate": 1.855949078725442e-07, "loss": 1.9392311096191406, "step": 390 }, { "epoch": 0.6127920337035618, "grad_norm": 13.375, "learning_rate": 1.7369038065225742e-07, "loss": 1.9289718627929688, "step": 400 }, { "epoch": 0.6281118345461509, "grad_norm": 8.4375, "learning_rate": 1.619737775263556e-07, "loss": 1.8457157135009765, "step": 410 }, { "epoch": 0.6434316353887399, "grad_norm": 5.96875, "learning_rate": 1.5047395241981604e-07, "loss": 1.831606674194336, "step": 420 }, { "epoch": 0.658751436231329, "grad_norm": 8.375, "learning_rate": 1.3921922540862904e-07, "loss": 1.941716194152832, "step": 430 }, { "epoch": 0.674071237073918, "grad_norm": 5.1875, "learning_rate": 1.2823731297728534e-07, "loss": 1.8431577682495117, "step": 440 }, { "epoch": 0.6893910379165071, "grad_norm": 7.90625, "learning_rate": 1.175552597626985e-07, "loss": 2.0610845565795897, "step": 450 }, { "epoch": 0.7047108387590961, "grad_norm": 4.375, "learning_rate": 1.0719937195265555e-07, "loss": 1.9088102340698243, "step": 460 }, { "epoch": 0.7200306396016852, "grad_norm": 8.8125, "learning_rate": 9.719515250281121e-08, "loss": 1.9430780410766602, "step": 470 }, { "epoch": 0.7353504404442742, "grad_norm": 4.6875, "learning_rate": 8.756723833176374e-08, "loss": 1.8786405563354491, "step": 480 }, { "epoch": 0.7506702412868632, "grad_norm": 12.0625, "learning_rate": 7.833933964887984e-08, "loss": 1.9569564819335938, "step": 490 }, { "epoch": 0.7659900421294523, "grad_norm": 23.375, "learning_rate": 6.95341815642815e-08, "loss": 2.0343820571899416, "step": 500 }, { "epoch": 0.7813098429720413, "grad_norm": 7.84375, "learning_rate": 6.117344812479152e-08, "loss": 2.027488136291504, "step": 510 }, { "epoch": 0.7966296438146304, "grad_norm": 10.9375, "learning_rate": 5.3277728913655644e-08, "loss": 1.718618392944336, "step": 520 }, { "epoch": 0.8119494446572194, "grad_norm": 7.28125, "learning_rate": 4.586646834554864e-08, "loss": 1.826439666748047, "step": 530 }, { "epoch": 0.8272692454998085, "grad_norm": 16.125, "learning_rate": 3.895791778173288e-08, "loss": 1.8948688507080078, "step": 540 }, { "epoch": 0.8425890463423975, "grad_norm": 6.4375, "learning_rate": 3.256909058329335e-08, "loss": 1.9602611541748047, "step": 550 }, { "epoch": 0.8579088471849866, "grad_norm": 8.1875, "learning_rate": 2.671572021313695e-08, "loss": 1.9529207229614258, "step": 560 }, { "epoch": 0.8732286480275756, "grad_norm": 6.78125, "learning_rate": 2.1412221489936795e-08, "loss": 1.9812084197998048, "step": 570 }, { "epoch": 0.8885484488701647, "grad_norm": 9.5625, "learning_rate": 1.6671655089439186e-08, "loss": 2.084661865234375, "step": 580 }, { "epoch": 0.9038682497127537, "grad_norm": 4.9375, "learning_rate": 1.250569538055471e-08, "loss": 1.9481664657592774, "step": 590 }, { "epoch": 0.9191880505553428, "grad_norm": 4.53125, "learning_rate": 8.924601675441207e-09, "loss": 1.9511104583740235, "step": 600 }, { "epoch": 0.9345078513979318, "grad_norm": 17.0, "learning_rate": 5.937192964380555e-09, "loss": 2.0635440826416014, "step": 610 }, { "epoch": 0.9498276522405209, "grad_norm": 17.625, "learning_rate": 3.550826197667889e-09, "loss": 1.669927978515625, "step": 620 }, { "epoch": 0.9651474530831099, "grad_norm": 4.09375, "learning_rate": 1.7713781679977447e-09, "loss": 1.881399917602539, "step": 630 }, { "epoch": 0.980467253925699, "grad_norm": 5.03125, "learning_rate": 6.032310379642803e-10, "loss": 1.9342432022094727, "step": 640 }, { "epoch": 0.995787054768288, "grad_norm": 6.15625, "learning_rate": 4.926154831655371e-11, "loss": 1.9714859008789063, "step": 650 }, { "epoch": 1.0, "step": 653, "total_flos": 3.143810179830989e+17, "train_loss": 1.9069785443783536, "train_runtime": 5405.3324, "train_samples_per_second": 0.483, "train_steps_per_second": 0.121 } ], "logging_steps": 10, "max_steps": 653, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.143810179830989e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }