{ "best_metric": null, "best_model_checkpoint": null, "epoch": 2.995875721748694, "eval_steps": 500, "global_step": 1362, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.021996150673632114, "grad_norm": 44.935070793507286, "learning_rate": 5e-06, "loss": 0.7982, "step": 10 }, { "epoch": 0.04399230134726423, "grad_norm": 51.99237463948744, "learning_rate": 5e-06, "loss": 0.6818, "step": 20 }, { "epoch": 0.06598845202089634, "grad_norm": 2.029518123215705, "learning_rate": 5e-06, "loss": 0.6576, "step": 30 }, { "epoch": 0.08798460269452846, "grad_norm": 0.8501991380139163, "learning_rate": 5e-06, "loss": 0.6179, "step": 40 }, { "epoch": 0.10998075336816057, "grad_norm": 0.7157876899989635, "learning_rate": 5e-06, "loss": 0.5951, "step": 50 }, { "epoch": 0.1319769040417927, "grad_norm": 0.6923489466872192, "learning_rate": 5e-06, "loss": 0.579, "step": 60 }, { "epoch": 0.1539730547154248, "grad_norm": 0.6162592994801409, "learning_rate": 5e-06, "loss": 0.5625, "step": 70 }, { "epoch": 0.17596920538905692, "grad_norm": 0.6070124857659416, "learning_rate": 5e-06, "loss": 0.5544, "step": 80 }, { "epoch": 0.19796535606268903, "grad_norm": 0.7389354403531135, "learning_rate": 5e-06, "loss": 0.5474, "step": 90 }, { "epoch": 0.21996150673632114, "grad_norm": 0.5830266561233308, "learning_rate": 5e-06, "loss": 0.5403, "step": 100 }, { "epoch": 0.24195765740995326, "grad_norm": 0.609863769379669, "learning_rate": 5e-06, "loss": 0.5409, "step": 110 }, { "epoch": 0.2639538080835854, "grad_norm": 0.5471425920538027, "learning_rate": 5e-06, "loss": 0.5282, "step": 120 }, { "epoch": 0.28594995875721746, "grad_norm": 0.5504648496085665, "learning_rate": 5e-06, "loss": 0.5315, "step": 130 }, { "epoch": 0.3079461094308496, "grad_norm": 0.5600291116467604, "learning_rate": 5e-06, "loss": 0.5307, "step": 140 }, { "epoch": 0.3299422601044817, "grad_norm": 0.6781742737436763, "learning_rate": 5e-06, "loss": 0.5256, "step": 150 }, { "epoch": 0.35193841077811383, "grad_norm": 0.5570436479921453, "learning_rate": 5e-06, "loss": 0.5236, "step": 160 }, { "epoch": 0.3739345614517459, "grad_norm": 0.7382087470875334, "learning_rate": 5e-06, "loss": 0.5148, "step": 170 }, { "epoch": 0.39593071212537806, "grad_norm": 0.6677212573270707, "learning_rate": 5e-06, "loss": 0.5147, "step": 180 }, { "epoch": 0.41792686279901015, "grad_norm": 0.6534622609569957, "learning_rate": 5e-06, "loss": 0.5184, "step": 190 }, { "epoch": 0.4399230134726423, "grad_norm": 0.6389305122495185, "learning_rate": 5e-06, "loss": 0.5099, "step": 200 }, { "epoch": 0.4619191641462744, "grad_norm": 0.5533607211490192, "learning_rate": 5e-06, "loss": 0.5117, "step": 210 }, { "epoch": 0.4839153148199065, "grad_norm": 0.5615265500686734, "learning_rate": 5e-06, "loss": 0.5055, "step": 220 }, { "epoch": 0.5059114654935386, "grad_norm": 0.6044913138154236, "learning_rate": 5e-06, "loss": 0.5043, "step": 230 }, { "epoch": 0.5279076161671707, "grad_norm": 0.6911732267120813, "learning_rate": 5e-06, "loss": 0.5084, "step": 240 }, { "epoch": 0.5499037668408029, "grad_norm": 0.6913728871930638, "learning_rate": 5e-06, "loss": 0.5007, "step": 250 }, { "epoch": 0.5718999175144349, "grad_norm": 0.5458408162252775, "learning_rate": 5e-06, "loss": 0.5004, "step": 260 }, { "epoch": 0.5938960681880671, "grad_norm": 0.4864371771009518, "learning_rate": 5e-06, "loss": 0.4997, "step": 270 }, { "epoch": 0.6158922188616992, "grad_norm": 0.5505465151810486, "learning_rate": 5e-06, "loss": 0.4933, "step": 280 }, { "epoch": 0.6378883695353313, "grad_norm": 0.5500982529995515, "learning_rate": 5e-06, "loss": 0.4969, "step": 290 }, { "epoch": 0.6598845202089634, "grad_norm": 0.6818273388657722, "learning_rate": 5e-06, "loss": 0.4971, "step": 300 }, { "epoch": 0.6818806708825955, "grad_norm": 0.8228558846974066, "learning_rate": 5e-06, "loss": 0.4883, "step": 310 }, { "epoch": 0.7038768215562277, "grad_norm": 0.5100124377410133, "learning_rate": 5e-06, "loss": 0.4912, "step": 320 }, { "epoch": 0.7258729722298598, "grad_norm": 0.5023160939160082, "learning_rate": 5e-06, "loss": 0.4961, "step": 330 }, { "epoch": 0.7478691229034918, "grad_norm": 0.5390556024217283, "learning_rate": 5e-06, "loss": 0.4879, "step": 340 }, { "epoch": 0.769865273577124, "grad_norm": 0.5699354382297954, "learning_rate": 5e-06, "loss": 0.4948, "step": 350 }, { "epoch": 0.7918614242507561, "grad_norm": 0.5193233018168463, "learning_rate": 5e-06, "loss": 0.491, "step": 360 }, { "epoch": 0.8138575749243883, "grad_norm": 0.4831702719594887, "learning_rate": 5e-06, "loss": 0.4924, "step": 370 }, { "epoch": 0.8358537255980203, "grad_norm": 0.46518212576460566, "learning_rate": 5e-06, "loss": 0.485, "step": 380 }, { "epoch": 0.8578498762716524, "grad_norm": 0.6352722047223296, "learning_rate": 5e-06, "loss": 0.4913, "step": 390 }, { "epoch": 0.8798460269452846, "grad_norm": 0.53358894593737, "learning_rate": 5e-06, "loss": 0.4946, "step": 400 }, { "epoch": 0.9018421776189167, "grad_norm": 0.7885388229348029, "learning_rate": 5e-06, "loss": 0.478, "step": 410 }, { "epoch": 0.9238383282925487, "grad_norm": 0.529600748072463, "learning_rate": 5e-06, "loss": 0.485, "step": 420 }, { "epoch": 0.9458344789661809, "grad_norm": 0.7784357593762018, "learning_rate": 5e-06, "loss": 0.4841, "step": 430 }, { "epoch": 0.967830629639813, "grad_norm": 0.5061344396278, "learning_rate": 5e-06, "loss": 0.4805, "step": 440 }, { "epoch": 0.9898267803134452, "grad_norm": 0.6066757845714082, "learning_rate": 5e-06, "loss": 0.4822, "step": 450 }, { "epoch": 0.998625240582898, "eval_loss": 0.4843384027481079, "eval_runtime": 321.1703, "eval_samples_per_second": 38.145, "eval_steps_per_second": 0.598, "step": 454 }, { "epoch": 1.0118229309870772, "grad_norm": 0.6845501483696066, "learning_rate": 5e-06, "loss": 0.4742, "step": 460 }, { "epoch": 1.0338190816607093, "grad_norm": 0.5184208422093173, "learning_rate": 5e-06, "loss": 0.4381, "step": 470 }, { "epoch": 1.0558152323343415, "grad_norm": 0.5477404832032738, "learning_rate": 5e-06, "loss": 0.4396, "step": 480 }, { "epoch": 1.0778113830079736, "grad_norm": 0.5481304063783221, "learning_rate": 5e-06, "loss": 0.436, "step": 490 }, { "epoch": 1.0998075336816058, "grad_norm": 0.560826060704074, "learning_rate": 5e-06, "loss": 0.4308, "step": 500 }, { "epoch": 1.121803684355238, "grad_norm": 0.5361777988288693, "learning_rate": 5e-06, "loss": 0.4368, "step": 510 }, { "epoch": 1.14379983502887, "grad_norm": 0.6716133763509267, "learning_rate": 5e-06, "loss": 0.4419, "step": 520 }, { "epoch": 1.165795985702502, "grad_norm": 0.5542234581455023, "learning_rate": 5e-06, "loss": 0.4361, "step": 530 }, { "epoch": 1.1877921363761341, "grad_norm": 0.7101633877411753, "learning_rate": 5e-06, "loss": 0.4345, "step": 540 }, { "epoch": 1.2097882870497663, "grad_norm": 0.5238276115814429, "learning_rate": 5e-06, "loss": 0.4339, "step": 550 }, { "epoch": 1.2317844377233984, "grad_norm": 0.603854926816251, "learning_rate": 5e-06, "loss": 0.4385, "step": 560 }, { "epoch": 1.2537805883970305, "grad_norm": 0.5352576431626216, "learning_rate": 5e-06, "loss": 0.4329, "step": 570 }, { "epoch": 1.2757767390706627, "grad_norm": 0.6947929349739098, "learning_rate": 5e-06, "loss": 0.4333, "step": 580 }, { "epoch": 1.2977728897442948, "grad_norm": 0.4804562251229763, "learning_rate": 5e-06, "loss": 0.4317, "step": 590 }, { "epoch": 1.3197690404179268, "grad_norm": 0.48050470497866915, "learning_rate": 5e-06, "loss": 0.4294, "step": 600 }, { "epoch": 1.341765191091559, "grad_norm": 0.5373174751277382, "learning_rate": 5e-06, "loss": 0.4305, "step": 610 }, { "epoch": 1.363761341765191, "grad_norm": 0.6344457366504956, "learning_rate": 5e-06, "loss": 0.4358, "step": 620 }, { "epoch": 1.3857574924388232, "grad_norm": 0.5663331681106669, "learning_rate": 5e-06, "loss": 0.433, "step": 630 }, { "epoch": 1.4077536431124553, "grad_norm": 0.5460973181725048, "learning_rate": 5e-06, "loss": 0.4316, "step": 640 }, { "epoch": 1.4297497937860875, "grad_norm": 0.5442052750881347, "learning_rate": 5e-06, "loss": 0.4309, "step": 650 }, { "epoch": 1.4517459444597196, "grad_norm": 0.5157106290187707, "learning_rate": 5e-06, "loss": 0.438, "step": 660 }, { "epoch": 1.4737420951333515, "grad_norm": 0.46892587832002125, "learning_rate": 5e-06, "loss": 0.4279, "step": 670 }, { "epoch": 1.495738245806984, "grad_norm": 0.5037695737266917, "learning_rate": 5e-06, "loss": 0.4326, "step": 680 }, { "epoch": 1.5177343964806158, "grad_norm": 0.48561399580013187, "learning_rate": 5e-06, "loss": 0.4359, "step": 690 }, { "epoch": 1.539730547154248, "grad_norm": 0.5653965550940685, "learning_rate": 5e-06, "loss": 0.4291, "step": 700 }, { "epoch": 1.56172669782788, "grad_norm": 0.5113826224264425, "learning_rate": 5e-06, "loss": 0.4303, "step": 710 }, { "epoch": 1.5837228485015122, "grad_norm": 0.7476801211084287, "learning_rate": 5e-06, "loss": 0.4324, "step": 720 }, { "epoch": 1.6057189991751444, "grad_norm": 0.4798585808975909, "learning_rate": 5e-06, "loss": 0.4345, "step": 730 }, { "epoch": 1.6277151498487763, "grad_norm": 0.5013555582898901, "learning_rate": 5e-06, "loss": 0.4311, "step": 740 }, { "epoch": 1.6497113005224087, "grad_norm": 0.5533026167279893, "learning_rate": 5e-06, "loss": 0.4297, "step": 750 }, { "epoch": 1.6717074511960406, "grad_norm": 0.5907648181268995, "learning_rate": 5e-06, "loss": 0.4258, "step": 760 }, { "epoch": 1.693703601869673, "grad_norm": 0.5116875739971738, "learning_rate": 5e-06, "loss": 0.4308, "step": 770 }, { "epoch": 1.7156997525433049, "grad_norm": 0.525277015168684, "learning_rate": 5e-06, "loss": 0.4278, "step": 780 }, { "epoch": 1.737695903216937, "grad_norm": 0.5212298654810674, "learning_rate": 5e-06, "loss": 0.4267, "step": 790 }, { "epoch": 1.7596920538905692, "grad_norm": 0.6835093490085559, "learning_rate": 5e-06, "loss": 0.4323, "step": 800 }, { "epoch": 1.7816882045642013, "grad_norm": 0.8213379235049009, "learning_rate": 5e-06, "loss": 0.4265, "step": 810 }, { "epoch": 1.8036843552378334, "grad_norm": 0.671899265464039, "learning_rate": 5e-06, "loss": 0.4299, "step": 820 }, { "epoch": 1.8256805059114654, "grad_norm": 0.7589383979560413, "learning_rate": 5e-06, "loss": 0.4254, "step": 830 }, { "epoch": 1.8476766565850977, "grad_norm": 0.6394372109420436, "learning_rate": 5e-06, "loss": 0.4268, "step": 840 }, { "epoch": 1.8696728072587296, "grad_norm": 0.5031956602689452, "learning_rate": 5e-06, "loss": 0.4229, "step": 850 }, { "epoch": 1.8916689579323618, "grad_norm": 0.7072710176459912, "learning_rate": 5e-06, "loss": 0.4238, "step": 860 }, { "epoch": 1.913665108605994, "grad_norm": 0.5781484479035767, "learning_rate": 5e-06, "loss": 0.4267, "step": 870 }, { "epoch": 1.935661259279626, "grad_norm": 0.50576234221162, "learning_rate": 5e-06, "loss": 0.426, "step": 880 }, { "epoch": 1.9576574099532582, "grad_norm": 0.559285180763617, "learning_rate": 5e-06, "loss": 0.4274, "step": 890 }, { "epoch": 1.9796535606268901, "grad_norm": 0.4843867002926747, "learning_rate": 5e-06, "loss": 0.4246, "step": 900 }, { "epoch": 1.9994500962331592, "eval_loss": 0.46506866812705994, "eval_runtime": 316.6503, "eval_samples_per_second": 38.689, "eval_steps_per_second": 0.606, "step": 909 }, { "epoch": 2.0016497113005225, "grad_norm": 0.8494799052840408, "learning_rate": 5e-06, "loss": 0.4343, "step": 910 }, { "epoch": 2.0236458619741544, "grad_norm": 0.7542208485006762, "learning_rate": 5e-06, "loss": 0.3763, "step": 920 }, { "epoch": 2.045642012647787, "grad_norm": 0.5843095386968228, "learning_rate": 5e-06, "loss": 0.3715, "step": 930 }, { "epoch": 2.0676381633214187, "grad_norm": 0.8058969339731762, "learning_rate": 5e-06, "loss": 0.3793, "step": 940 }, { "epoch": 2.089634313995051, "grad_norm": 0.8326514799311344, "learning_rate": 5e-06, "loss": 0.3768, "step": 950 }, { "epoch": 2.111630464668683, "grad_norm": 0.6448233607735808, "learning_rate": 5e-06, "loss": 0.381, "step": 960 }, { "epoch": 2.133626615342315, "grad_norm": 0.5603778242637936, "learning_rate": 5e-06, "loss": 0.3779, "step": 970 }, { "epoch": 2.1556227660159473, "grad_norm": 0.7046094765859149, "learning_rate": 5e-06, "loss": 0.3757, "step": 980 }, { "epoch": 2.177618916689579, "grad_norm": 0.6615858803316566, "learning_rate": 5e-06, "loss": 0.3799, "step": 990 }, { "epoch": 2.1996150673632116, "grad_norm": 0.5789910902142025, "learning_rate": 5e-06, "loss": 0.3791, "step": 1000 }, { "epoch": 2.2216112180368435, "grad_norm": 0.6112779977098899, "learning_rate": 5e-06, "loss": 0.3767, "step": 1010 }, { "epoch": 2.243607368710476, "grad_norm": 0.5885271436566493, "learning_rate": 5e-06, "loss": 0.3775, "step": 1020 }, { "epoch": 2.2656035193841078, "grad_norm": 0.6688990731888627, "learning_rate": 5e-06, "loss": 0.3776, "step": 1030 }, { "epoch": 2.28759967005774, "grad_norm": 0.7043543929663795, "learning_rate": 5e-06, "loss": 0.3768, "step": 1040 }, { "epoch": 2.309595820731372, "grad_norm": 0.7912879028175118, "learning_rate": 5e-06, "loss": 0.3743, "step": 1050 }, { "epoch": 2.331591971405004, "grad_norm": 0.6172549511091338, "learning_rate": 5e-06, "loss": 0.3817, "step": 1060 }, { "epoch": 2.3535881220786363, "grad_norm": 0.5772395414215311, "learning_rate": 5e-06, "loss": 0.3782, "step": 1070 }, { "epoch": 2.3755842727522682, "grad_norm": 0.5396724355578864, "learning_rate": 5e-06, "loss": 0.3802, "step": 1080 }, { "epoch": 2.3975804234259006, "grad_norm": 0.5780443375091662, "learning_rate": 5e-06, "loss": 0.3756, "step": 1090 }, { "epoch": 2.4195765740995325, "grad_norm": 0.7751240393805268, "learning_rate": 5e-06, "loss": 0.3792, "step": 1100 }, { "epoch": 2.441572724773165, "grad_norm": 0.568262735148636, "learning_rate": 5e-06, "loss": 0.3842, "step": 1110 }, { "epoch": 2.463568875446797, "grad_norm": 0.7876139455832769, "learning_rate": 5e-06, "loss": 0.3767, "step": 1120 }, { "epoch": 2.4855650261204287, "grad_norm": 0.6545602235246707, "learning_rate": 5e-06, "loss": 0.3827, "step": 1130 }, { "epoch": 2.507561176794061, "grad_norm": 0.6169218266323959, "learning_rate": 5e-06, "loss": 0.3849, "step": 1140 }, { "epoch": 2.529557327467693, "grad_norm": 0.5892651118636095, "learning_rate": 5e-06, "loss": 0.3813, "step": 1150 }, { "epoch": 2.5515534781413254, "grad_norm": 0.6065064990736145, "learning_rate": 5e-06, "loss": 0.3804, "step": 1160 }, { "epoch": 2.5735496288149573, "grad_norm": 0.5193806106328419, "learning_rate": 5e-06, "loss": 0.3751, "step": 1170 }, { "epoch": 2.5955457794885897, "grad_norm": 0.8060929375102633, "learning_rate": 5e-06, "loss": 0.3731, "step": 1180 }, { "epoch": 2.6175419301622216, "grad_norm": 0.5602720976042392, "learning_rate": 5e-06, "loss": 0.3757, "step": 1190 }, { "epoch": 2.6395380808358535, "grad_norm": 0.5369906898701031, "learning_rate": 5e-06, "loss": 0.3742, "step": 1200 }, { "epoch": 2.661534231509486, "grad_norm": 0.5808022200937785, "learning_rate": 5e-06, "loss": 0.3753, "step": 1210 }, { "epoch": 2.683530382183118, "grad_norm": 0.5699624059009394, "learning_rate": 5e-06, "loss": 0.3741, "step": 1220 }, { "epoch": 2.70552653285675, "grad_norm": 0.591131213351509, "learning_rate": 5e-06, "loss": 0.3785, "step": 1230 }, { "epoch": 2.727522683530382, "grad_norm": 0.6838767595972525, "learning_rate": 5e-06, "loss": 0.3761, "step": 1240 }, { "epoch": 2.7495188342040144, "grad_norm": 0.584986984671218, "learning_rate": 5e-06, "loss": 0.3748, "step": 1250 }, { "epoch": 2.7715149848776464, "grad_norm": 0.8416063162832514, "learning_rate": 5e-06, "loss": 0.3728, "step": 1260 }, { "epoch": 2.7935111355512783, "grad_norm": 0.5715014930298087, "learning_rate": 5e-06, "loss": 0.3794, "step": 1270 }, { "epoch": 2.8155072862249106, "grad_norm": 0.5701895352860433, "learning_rate": 5e-06, "loss": 0.3789, "step": 1280 }, { "epoch": 2.837503436898543, "grad_norm": 0.5198659680168832, "learning_rate": 5e-06, "loss": 0.3732, "step": 1290 }, { "epoch": 2.859499587572175, "grad_norm": 0.642696455858834, "learning_rate": 5e-06, "loss": 0.3741, "step": 1300 }, { "epoch": 2.881495738245807, "grad_norm": 0.5347069585895822, "learning_rate": 5e-06, "loss": 0.3753, "step": 1310 }, { "epoch": 2.903491888919439, "grad_norm": 0.6499155207375088, "learning_rate": 5e-06, "loss": 0.3756, "step": 1320 }, { "epoch": 2.925488039593071, "grad_norm": 0.7295378497969262, "learning_rate": 5e-06, "loss": 0.378, "step": 1330 }, { "epoch": 2.947484190266703, "grad_norm": 0.6568947705176402, "learning_rate": 5e-06, "loss": 0.3795, "step": 1340 }, { "epoch": 2.9694803409403354, "grad_norm": 0.532205526706625, "learning_rate": 5e-06, "loss": 0.3742, "step": 1350 }, { "epoch": 2.991476491613968, "grad_norm": 0.5881809630311479, "learning_rate": 5e-06, "loss": 0.3735, "step": 1360 }, { "epoch": 2.995875721748694, "eval_loss": 0.46309909224510193, "eval_runtime": 307.2866, "eval_samples_per_second": 39.868, "eval_steps_per_second": 0.625, "step": 1362 }, { "epoch": 2.995875721748694, "step": 1362, "total_flos": 2281191348633600.0, "train_loss": 0.44531785190192963, "train_runtime": 45435.4893, "train_samples_per_second": 15.368, "train_steps_per_second": 0.03 } ], "logging_steps": 10, "max_steps": 1362, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2281191348633600.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }