{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.5002627430373097, "eval_steps": 500, "global_step": 714, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.021019442984760904, "grad_norm": 7.8125, "learning_rate": 1.2272727272727274e-06, "loss": 2.139740753173828, "step": 10 }, { "epoch": 0.04203888596952181, "grad_norm": 5.96875, "learning_rate": 2.590909090909091e-06, "loss": 2.2081624984741213, "step": 20 }, { "epoch": 0.0630583289542827, "grad_norm": 14.125, "learning_rate": 2.999242629561838e-06, "loss": 2.0339645385742187, "step": 30 }, { "epoch": 0.08407777193904362, "grad_norm": 5.90625, "learning_rate": 2.995534901109399e-06, "loss": 2.0348079681396483, "step": 40 }, { "epoch": 0.10509721492380451, "grad_norm": 4.8125, "learning_rate": 2.9887453367135033e-06, "loss": 1.950754165649414, "step": 50 }, { "epoch": 0.1261166579085654, "grad_norm": 6.09375, "learning_rate": 2.9788879275712665e-06, "loss": 1.9394699096679688, "step": 60 }, { "epoch": 0.14713610089332632, "grad_norm": 2.921875, "learning_rate": 2.9659829867611603e-06, "loss": 1.880813980102539, "step": 70 }, { "epoch": 0.16815554387808723, "grad_norm": 3.96875, "learning_rate": 2.9500571073840264e-06, "loss": 1.8970605850219726, "step": 80 }, { "epoch": 0.18917498686284814, "grad_norm": 4.1875, "learning_rate": 2.931143107762901e-06, "loss": 1.8591070175170898, "step": 90 }, { "epoch": 0.21019442984760903, "grad_norm": 2.359375, "learning_rate": 2.909279963814576e-06, "loss": 1.892710304260254, "step": 100 }, { "epoch": 0.23121387283236994, "grad_norm": 3.125, "learning_rate": 2.8845127287322656e-06, "loss": 1.8118453979492188, "step": 110 }, { "epoch": 0.2522333158171308, "grad_norm": 2.71875, "learning_rate": 2.8568924401448738e-06, "loss": 1.8849889755249023, "step": 120 }, { "epoch": 0.27325275880189176, "grad_norm": 1.8203125, "learning_rate": 2.826476014944193e-06, "loss": 1.8813108444213866, "step": 130 }, { "epoch": 0.29427220178665264, "grad_norm": 2.265625, "learning_rate": 2.7933261319967516e-06, "loss": 1.9071147918701172, "step": 140 }, { "epoch": 0.3152916447714136, "grad_norm": 2.828125, "learning_rate": 2.7575111029820103e-06, "loss": 1.8963701248168945, "step": 150 }, { "epoch": 0.33631108775617446, "grad_norm": 2.953125, "learning_rate": 2.7191047316230743e-06, "loss": 1.9282533645629882, "step": 160 }, { "epoch": 0.35733053074093535, "grad_norm": 1.65625, "learning_rate": 2.6781861615999896e-06, "loss": 1.7661924362182617, "step": 170 }, { "epoch": 0.3783499737256963, "grad_norm": 2.078125, "learning_rate": 2.6348397134590424e-06, "loss": 1.784163475036621, "step": 180 }, { "epoch": 0.39936941671045717, "grad_norm": 1.765625, "learning_rate": 2.5891547108541323e-06, "loss": 1.8109502792358398, "step": 190 }, { "epoch": 0.42038885969521805, "grad_norm": 3.0625, "learning_rate": 2.5412252964782867e-06, "loss": 1.821950912475586, "step": 200 }, { "epoch": 0.441408302679979, "grad_norm": 2.453125, "learning_rate": 2.4911502380646164e-06, "loss": 1.9059152603149414, "step": 210 }, { "epoch": 0.4624277456647399, "grad_norm": 2.875, "learning_rate": 2.4390327248564994e-06, "loss": 1.8420991897583008, "step": 220 }, { "epoch": 0.4834471886495008, "grad_norm": 2.5, "learning_rate": 2.3849801549663886e-06, "loss": 1.890372085571289, "step": 230 }, { "epoch": 0.5044666316342616, "grad_norm": 2.484375, "learning_rate": 2.3291039140614475e-06, "loss": 1.8288061141967773, "step": 240 }, { "epoch": 0.5254860746190226, "grad_norm": 3.109375, "learning_rate": 2.2715191458320545e-06, "loss": 1.8653709411621093, "step": 250 }, { "epoch": 0.5465055176037835, "grad_norm": 2.109375, "learning_rate": 2.212344514716194e-06, "loss": 1.771567153930664, "step": 260 }, { "epoch": 0.5675249605885444, "grad_norm": 1.953125, "learning_rate": 2.151701961368664e-06, "loss": 1.7724361419677734, "step": 270 }, { "epoch": 0.5885444035733053, "grad_norm": 4.6875, "learning_rate": 2.0897164513790135e-06, "loss": 1.7283151626586915, "step": 280 }, { "epoch": 0.6095638465580662, "grad_norm": 2.8125, "learning_rate": 2.026515717756026e-06, "loss": 1.7711864471435548, "step": 290 }, { "epoch": 0.6305832895428272, "grad_norm": 5.0, "learning_rate": 1.9622299977094044e-06, "loss": 1.7970991134643555, "step": 300 }, { "epoch": 0.651602732527588, "grad_norm": 1.890625, "learning_rate": 1.8969917642710664e-06, "loss": 1.8020233154296874, "step": 310 }, { "epoch": 0.6726221755123489, "grad_norm": 1.65625, "learning_rate": 1.830935453309108e-06, "loss": 1.8001415252685546, "step": 320 }, { "epoch": 0.6936416184971098, "grad_norm": 2.3125, "learning_rate": 1.764197186496962e-06, "loss": 1.75347843170166, "step": 330 }, { "epoch": 0.7146610614818707, "grad_norm": 6.4375, "learning_rate": 1.6969144908086306e-06, "loss": 1.809716033935547, "step": 340 }, { "epoch": 0.7356805044666316, "grad_norm": 1.9921875, "learning_rate": 1.6292260151180326e-06, "loss": 1.7866138458251952, "step": 350 }, { "epoch": 0.7566999474513926, "grad_norm": 3.6875, "learning_rate": 1.5612712444864579e-06, "loss": 1.8378917694091796, "step": 360 }, { "epoch": 0.7777193904361535, "grad_norm": 2.078125, "learning_rate": 1.4931902127268951e-06, "loss": 1.7029869079589843, "step": 370 }, { "epoch": 0.7987388334209143, "grad_norm": 1.9453125, "learning_rate": 1.4251232138375584e-06, "loss": 1.7460771560668946, "step": 380 }, { "epoch": 0.8197582764056752, "grad_norm": 2.359375, "learning_rate": 1.3572105128992455e-06, "loss": 1.7742759704589843, "step": 390 }, { "epoch": 0.8407777193904361, "grad_norm": 3.78125, "learning_rate": 1.2895920570322904e-06, "loss": 1.8007017135620118, "step": 400 }, { "epoch": 0.8617971623751971, "grad_norm": 2.484375, "learning_rate": 1.2224071870087317e-06, "loss": 1.7528308868408202, "step": 410 }, { "epoch": 0.882816605359958, "grad_norm": 2.375, "learning_rate": 1.1557943501139813e-06, "loss": 1.8043436050415038, "step": 420 }, { "epoch": 0.9038360483447189, "grad_norm": 1.625, "learning_rate": 1.0898908148496853e-06, "loss": 1.7981443405151367, "step": 430 }, { "epoch": 0.9248554913294798, "grad_norm": 3.390625, "learning_rate": 1.0248323880657068e-06, "loss": 1.7500328063964843, "step": 440 }, { "epoch": 0.9458749343142406, "grad_norm": 3.0, "learning_rate": 9.607531351041108e-07, "loss": 1.7884363174438476, "step": 450 }, { "epoch": 0.9668943772990016, "grad_norm": 2.859375, "learning_rate": 8.977851035318654e-07, "loss": 1.714197540283203, "step": 460 }, { "epoch": 0.9879138202837625, "grad_norm": 2.125, "learning_rate": 8.360580510315521e-07, "loss": 1.7554092407226562, "step": 470 }, { "epoch": 1.0084077771939044, "grad_norm": 2.421875, "learning_rate": 7.756991780108238e-07, "loss": 1.7379329681396485, "step": 480 }, { "epoch": 1.0294272201786652, "grad_norm": 2.453125, "learning_rate": 7.168328654816127e-07, "loss": 1.692732810974121, "step": 490 }, { "epoch": 1.0504466631634262, "grad_norm": 2.40625, "learning_rate": 6.595804187492498e-07, "loss": 1.8081771850585937, "step": 500 }, { "epoch": 1.0714661061481872, "grad_norm": 2.71875, "learning_rate": 6.0405981743966e-07, "loss": 1.7980724334716798, "step": 510 }, { "epoch": 1.092485549132948, "grad_norm": 4.34375, "learning_rate": 5.503854723797599e-07, "loss": 1.764889907836914, "step": 520 }, { "epoch": 1.113504992117709, "grad_norm": 4.53125, "learning_rate": 4.986679898320476e-07, "loss": 1.7189857482910156, "step": 530 }, { "epoch": 1.1345244351024697, "grad_norm": 3.296875, "learning_rate": 4.490139435692261e-07, "loss": 1.7537565231323242, "step": 540 }, { "epoch": 1.1555438780872307, "grad_norm": 3.234375, "learning_rate": 4.0152565525854467e-07, "loss": 1.6921497344970704, "step": 550 }, { "epoch": 1.1765633210719917, "grad_norm": 3.15625, "learning_rate": 3.5630098360841646e-07, "loss": 1.7711572647094727, "step": 560 }, { "epoch": 1.1975827640567525, "grad_norm": 1.8671875, "learning_rate": 3.134331227118171e-07, "loss": 1.6838041305541993, "step": 570 }, { "epoch": 1.2186022070415135, "grad_norm": 2.09375, "learning_rate": 2.7301041000201746e-07, "loss": 1.73205509185791, "step": 580 }, { "epoch": 1.2396216500262742, "grad_norm": 2.234375, "learning_rate": 2.351161442163905e-07, "loss": 1.7526542663574218, "step": 590 }, { "epoch": 1.2606410930110352, "grad_norm": 1.5859375, "learning_rate": 1.998284137434206e-07, "loss": 1.7869752883911132, "step": 600 }, { "epoch": 1.2816605359957962, "grad_norm": 2.375, "learning_rate": 1.6721993570662926e-07, "loss": 1.828580093383789, "step": 610 }, { "epoch": 1.302679978980557, "grad_norm": 2.609375, "learning_rate": 1.3735790611702274e-07, "loss": 1.7601003646850586, "step": 620 }, { "epoch": 1.323699421965318, "grad_norm": 3.59375, "learning_rate": 1.1030386140284865e-07, "loss": 1.7960094451904296, "step": 630 }, { "epoch": 1.3447188649500788, "grad_norm": 3.046875, "learning_rate": 8.611355160200623e-08, "loss": 1.7016435623168946, "step": 640 }, { "epoch": 1.3657383079348397, "grad_norm": 1.7890625, "learning_rate": 6.483682547842001e-08, "loss": 1.7239088058471679, "step": 650 }, { "epoch": 1.3867577509196005, "grad_norm": 1.6796875, "learning_rate": 4.651752779912233e-08, "loss": 1.7699031829833984, "step": 660 }, { "epoch": 1.4077771939043615, "grad_norm": 1.9140625, "learning_rate": 3.1193408983715475e-08, "loss": 1.8059171676635741, "step": 670 }, { "epoch": 1.4287966368891225, "grad_norm": 3.25, "learning_rate": 1.8896047312406683e-08, "loss": 1.7002668380737305, "step": 680 }, { "epoch": 1.4498160798738833, "grad_norm": 2.015625, "learning_rate": 9.650783852917178e-09, "loss": 1.7966609954833985, "step": 690 }, { "epoch": 1.4708355228586443, "grad_norm": 2.328125, "learning_rate": 3.4766702403609684e-09, "loss": 1.7154333114624023, "step": 700 }, { "epoch": 1.4918549658434053, "grad_norm": 1.6875, "learning_rate": 3.8642941770372644e-10, "loss": 1.7977441787719726, "step": 710 }, { "epoch": 1.5002627430373097, "step": 714, "total_flos": 3.4104097625680896e+17, "train_loss": 1.8137206637224896, "train_runtime": 5627.9871, "train_samples_per_second": 0.507, "train_steps_per_second": 0.127 } ], "logging_steps": 10, "max_steps": 714, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.4104097625680896e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }