{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9994722955145119, "eval_steps": 200, "global_step": 947, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010554089709762533, "grad_norm": 4.428989887237549, "learning_rate": 0.0, "loss": 1.4444, "step": 1 }, { "epoch": 0.010554089709762533, "grad_norm": 3.5337846279144287, "learning_rate": 1.8947368421052634e-06, "loss": 1.4272, "step": 10 }, { "epoch": 0.021108179419525065, "grad_norm": 1.0835645198822021, "learning_rate": 4.000000000000001e-06, "loss": 1.3383, "step": 20 }, { "epoch": 0.0316622691292876, "grad_norm": 1.217992901802063, "learning_rate": 6.105263157894738e-06, "loss": 1.2714, "step": 30 }, { "epoch": 0.04221635883905013, "grad_norm": 1.7282902002334595, "learning_rate": 8.210526315789475e-06, "loss": 1.2262, "step": 40 }, { "epoch": 0.052770448548812667, "grad_norm": 1.640160322189331, "learning_rate": 1.0315789473684213e-05, "loss": 1.1945, "step": 50 }, { "epoch": 0.0633245382585752, "grad_norm": 1.4558825492858887, "learning_rate": 1.2421052631578949e-05, "loss": 1.1686, "step": 60 }, { "epoch": 0.07387862796833773, "grad_norm": 1.016249656677246, "learning_rate": 1.4526315789473687e-05, "loss": 1.1422, "step": 70 }, { "epoch": 0.08443271767810026, "grad_norm": 0.7121432423591614, "learning_rate": 1.6631578947368423e-05, "loss": 1.1314, "step": 80 }, { "epoch": 0.09498680738786279, "grad_norm": 0.7841984033584595, "learning_rate": 1.873684210526316e-05, "loss": 1.1275, "step": 90 }, { "epoch": 0.10554089709762533, "grad_norm": 0.6388397216796875, "learning_rate": 1.999891231617599e-05, "loss": 1.1178, "step": 100 }, { "epoch": 0.11609498680738786, "grad_norm": 0.5346229076385498, "learning_rate": 1.9986678590325273e-05, "loss": 1.1205, "step": 110 }, { "epoch": 0.1266490765171504, "grad_norm": 0.6061886548995972, "learning_rate": 1.996086822074945e-05, "loss": 1.1135, "step": 120 }, { "epoch": 0.13720316622691292, "grad_norm": 0.5429868698120117, "learning_rate": 1.9921516296010645e-05, "loss": 1.1072, "step": 130 }, { "epoch": 0.14775725593667546, "grad_norm": 0.5146633386611938, "learning_rate": 1.9868676314081907e-05, "loss": 1.0997, "step": 140 }, { "epoch": 0.158311345646438, "grad_norm": 0.5138978362083435, "learning_rate": 1.980242010961803e-05, "loss": 1.0973, "step": 150 }, { "epoch": 0.16886543535620052, "grad_norm": 0.48871827125549316, "learning_rate": 1.9722837756298112e-05, "loss": 1.1089, "step": 160 }, { "epoch": 0.17941952506596306, "grad_norm": 0.5564476251602173, "learning_rate": 1.96300374443726e-05, "loss": 1.0914, "step": 170 }, { "epoch": 0.18997361477572558, "grad_norm": 0.48119252920150757, "learning_rate": 1.9524145333581315e-05, "loss": 1.1018, "step": 180 }, { "epoch": 0.20052770448548812, "grad_norm": 0.45517972111701965, "learning_rate": 1.9405305381642376e-05, "loss": 1.0982, "step": 190 }, { "epoch": 0.21108179419525067, "grad_norm": 0.47854238748550415, "learning_rate": 1.9273679148545246e-05, "loss": 1.0891, "step": 200 }, { "epoch": 0.21108179419525067, "eval_loss": 1.11018705368042, "eval_runtime": 269.0491, "eval_samples_per_second": 49.868, "eval_steps_per_second": 0.781, "step": 200 }, { "epoch": 0.22163588390501318, "grad_norm": 0.43568843603134155, "learning_rate": 1.9129445576913886e-05, "loss": 1.0998, "step": 210 }, { "epoch": 0.23218997361477572, "grad_norm": 0.4271477162837982, "learning_rate": 1.897280074873868e-05, "loss": 1.1231, "step": 220 }, { "epoch": 0.24274406332453827, "grad_norm": 0.44812774658203125, "learning_rate": 1.8803957618807764e-05, "loss": 1.1038, "step": 230 }, { "epoch": 0.2532981530343008, "grad_norm": 0.4037184417247772, "learning_rate": 1.862314572520028e-05, "loss": 1.1104, "step": 240 }, { "epoch": 0.2638522427440633, "grad_norm": 0.44267192482948303, "learning_rate": 1.843061087723496e-05, "loss": 1.0939, "step": 250 }, { "epoch": 0.27440633245382584, "grad_norm": 0.44187697768211365, "learning_rate": 1.8226614821298444e-05, "loss": 1.1081, "step": 260 }, { "epoch": 0.2849604221635884, "grad_norm": 0.41764840483665466, "learning_rate": 1.8011434885007482e-05, "loss": 1.0985, "step": 270 }, { "epoch": 0.2955145118733509, "grad_norm": 0.3874802589416504, "learning_rate": 1.7785363600188894e-05, "loss": 1.1005, "step": 280 }, { "epoch": 0.30606860158311344, "grad_norm": 0.3772076666355133, "learning_rate": 1.7548708305189724e-05, "loss": 1.09, "step": 290 }, { "epoch": 0.316622691292876, "grad_norm": 0.4143645167350769, "learning_rate": 1.7301790727058344e-05, "loss": 1.0849, "step": 300 }, { "epoch": 0.32717678100263853, "grad_norm": 0.43071797490119934, "learning_rate": 1.7044946544164434e-05, "loss": 1.0956, "step": 310 }, { "epoch": 0.33773087071240104, "grad_norm": 0.3988950252532959, "learning_rate": 1.6778524929852513e-05, "loss": 1.1042, "step": 320 }, { "epoch": 0.3482849604221636, "grad_norm": 0.40434718132019043, "learning_rate": 1.650288807774937e-05, "loss": 1.0978, "step": 330 }, { "epoch": 0.35883905013192613, "grad_norm": 0.41674408316612244, "learning_rate": 1.6218410709370735e-05, "loss": 1.0914, "step": 340 }, { "epoch": 0.36939313984168864, "grad_norm": 0.395465224981308, "learning_rate": 1.592547956469662e-05, "loss": 1.1126, "step": 350 }, { "epoch": 0.37994722955145116, "grad_norm": 0.3750782608985901, "learning_rate": 1.562449287640781e-05, "loss": 1.099, "step": 360 }, { "epoch": 0.39050131926121373, "grad_norm": 0.3862684369087219, "learning_rate": 1.5315859828498353e-05, "loss": 1.0933, "step": 370 }, { "epoch": 0.40105540897097625, "grad_norm": 0.40379074215888977, "learning_rate": 1.5000000000000002e-05, "loss": 1.0905, "step": 380 }, { "epoch": 0.41160949868073876, "grad_norm": 0.3791244328022003, "learning_rate": 1.4677342794574819e-05, "loss": 1.0835, "step": 390 }, { "epoch": 0.42216358839050133, "grad_norm": 0.36901775002479553, "learning_rate": 1.4348326856751496e-05, "loss": 1.095, "step": 400 }, { "epoch": 0.42216358839050133, "eval_loss": 1.0990158319473267, "eval_runtime": 269.2071, "eval_samples_per_second": 49.839, "eval_steps_per_second": 0.78, "step": 400 }, { "epoch": 0.43271767810026385, "grad_norm": 0.38086214661598206, "learning_rate": 1.401339947559889e-05, "loss": 1.1001, "step": 410 }, { "epoch": 0.44327176781002636, "grad_norm": 0.42641252279281616, "learning_rate": 1.367301597664757e-05, "loss": 1.085, "step": 420 }, { "epoch": 0.45382585751978893, "grad_norm": 0.37229016423225403, "learning_rate": 1.3327639102885939e-05, "loss": 1.0852, "step": 430 }, { "epoch": 0.46437994722955145, "grad_norm": 0.38543465733528137, "learning_rate": 1.2977738385672558e-05, "loss": 1.0982, "step": 440 }, { "epoch": 0.47493403693931396, "grad_norm": 0.36999842524528503, "learning_rate": 1.2623789506419792e-05, "loss": 1.0844, "step": 450 }, { "epoch": 0.48548812664907653, "grad_norm": 0.3730550706386566, "learning_rate": 1.2266273649916669e-05, "loss": 1.0838, "step": 460 }, { "epoch": 0.49604221635883905, "grad_norm": 0.35631632804870605, "learning_rate": 1.190567685016998e-05, "loss": 1.076, "step": 470 }, { "epoch": 0.5065963060686016, "grad_norm": 0.3838544487953186, "learning_rate": 1.1542489329653024e-05, "loss": 1.0831, "step": 480 }, { "epoch": 0.5171503957783641, "grad_norm": 0.40018004179000854, "learning_rate": 1.1177204832860214e-05, "loss": 1.0813, "step": 490 }, { "epoch": 0.5277044854881267, "grad_norm": 0.3892735540866852, "learning_rate": 1.08103199550736e-05, "loss": 1.0909, "step": 500 }, { "epoch": 0.5382585751978892, "grad_norm": 0.42785775661468506, "learning_rate": 1.044233346725379e-05, "loss": 1.0827, "step": 510 }, { "epoch": 0.5488126649076517, "grad_norm": 0.37400808930397034, "learning_rate": 1.0073745637973125e-05, "loss": 1.0896, "step": 520 }, { "epoch": 0.5593667546174143, "grad_norm": 0.38293296098709106, "learning_rate": 9.705057553312857e-06, "loss": 1.0847, "step": 530 }, { "epoch": 0.5699208443271768, "grad_norm": 0.39219433069229126, "learning_rate": 9.336770435648963e-06, "loss": 1.0833, "step": 540 }, { "epoch": 0.5804749340369393, "grad_norm": 0.3722192645072937, "learning_rate": 8.969384962252646e-06, "loss": 1.0823, "step": 550 }, { "epoch": 0.5910290237467019, "grad_norm": 0.4041948914527893, "learning_rate": 8.60340058463194e-06, "loss": 1.0733, "step": 560 }, { "epoch": 0.6015831134564644, "grad_norm": 0.36892595887184143, "learning_rate": 8.239314849539639e-06, "loss": 1.0618, "step": 570 }, { "epoch": 0.6121372031662269, "grad_norm": 0.3803699314594269, "learning_rate": 7.877622722570772e-06, "loss": 1.0896, "step": 580 }, { "epoch": 0.6226912928759895, "grad_norm": 0.3644523620605469, "learning_rate": 7.518815915269025e-06, "loss": 1.0819, "step": 590 }, { "epoch": 0.633245382585752, "grad_norm": 0.3542793095111847, "learning_rate": 7.163382216657033e-06, "loss": 1.0886, "step": 600 }, { "epoch": 0.633245382585752, "eval_loss": 1.090126872062683, "eval_runtime": 268.9072, "eval_samples_per_second": 49.895, "eval_steps_per_second": 0.781, "step": 600 }, { "epoch": 0.6437994722955145, "grad_norm": 0.3555884063243866, "learning_rate": 6.811804830099186e-06, "loss": 1.0655, "step": 610 }, { "epoch": 0.6543535620052771, "grad_norm": 0.3567143380641937, "learning_rate": 6.464561716398565e-06, "loss": 1.078, "step": 620 }, { "epoch": 0.6649076517150396, "grad_norm": 0.3770051598548889, "learning_rate": 6.122124944020978e-06, "loss": 1.0836, "step": 630 }, { "epoch": 0.6754617414248021, "grad_norm": 0.352397084236145, "learning_rate": 5.78496004732952e-06, "loss": 1.0719, "step": 640 }, { "epoch": 0.6860158311345647, "grad_norm": 0.3588451147079468, "learning_rate": 5.453525393702053e-06, "loss": 1.0849, "step": 650 }, { "epoch": 0.6965699208443272, "grad_norm": 0.40011218190193176, "learning_rate": 5.128271560392037e-06, "loss": 1.082, "step": 660 }, { "epoch": 0.7071240105540897, "grad_norm": 0.34496238827705383, "learning_rate": 4.809640721979856e-06, "loss": 1.077, "step": 670 }, { "epoch": 0.7176781002638523, "grad_norm": 0.38083967566490173, "learning_rate": 4.498066049247344e-06, "loss": 1.0639, "step": 680 }, { "epoch": 0.7282321899736148, "grad_norm": 0.3846307098865509, "learning_rate": 4.193971120292793e-06, "loss": 1.0778, "step": 690 }, { "epoch": 0.7387862796833773, "grad_norm": 0.33913660049438477, "learning_rate": 3.897769344686929e-06, "loss": 1.0952, "step": 700 }, { "epoch": 0.7493403693931399, "grad_norm": 0.3537193536758423, "learning_rate": 3.6098634014527866e-06, "loss": 1.0853, "step": 710 }, { "epoch": 0.7598944591029023, "grad_norm": 0.3514321446418762, "learning_rate": 3.330644691633492e-06, "loss": 1.0786, "step": 720 }, { "epoch": 0.7704485488126649, "grad_norm": 0.34657713770866394, "learning_rate": 3.0604928061921847e-06, "loss": 1.0609, "step": 730 }, { "epoch": 0.7810026385224275, "grad_norm": 0.34931546449661255, "learning_rate": 2.7997750099674282e-06, "loss": 1.0845, "step": 740 }, { "epoch": 0.7915567282321899, "grad_norm": 0.3565938174724579, "learning_rate": 2.548845742385717e-06, "loss": 1.0762, "step": 750 }, { "epoch": 0.8021108179419525, "grad_norm": 0.36780357360839844, "learning_rate": 2.3080461356097938e-06, "loss": 1.0719, "step": 760 }, { "epoch": 0.8126649076517151, "grad_norm": 0.3430708348751068, "learning_rate": 2.077703550777882e-06, "loss": 1.0945, "step": 770 }, { "epoch": 0.8232189973614775, "grad_norm": 0.361824631690979, "learning_rate": 1.8581311329642592e-06, "loss": 1.0916, "step": 780 }, { "epoch": 0.8337730870712401, "grad_norm": 0.3385472893714905, "learning_rate": 1.6496273854662482e-06, "loss": 1.084, "step": 790 }, { "epoch": 0.8443271767810027, "grad_norm": 0.3720723092556, "learning_rate": 1.452475763996326e-06, "loss": 1.0856, "step": 800 }, { "epoch": 0.8443271767810027, "eval_loss": 1.0849097967147827, "eval_runtime": 268.3585, "eval_samples_per_second": 49.997, "eval_steps_per_second": 0.783, "step": 800 }, { "epoch": 0.8548812664907651, "grad_norm": 0.3724263906478882, "learning_rate": 1.2669442913310725e-06, "loss": 1.0773, "step": 810 }, { "epoch": 0.8654353562005277, "grad_norm": 0.38541847467422485, "learning_rate": 1.0932851929407828e-06, "loss": 1.0793, "step": 820 }, { "epoch": 0.8759894459102903, "grad_norm": 0.3606375753879547, "learning_rate": 9.31734554095165e-07, "loss": 1.0976, "step": 830 }, { "epoch": 0.8865435356200527, "grad_norm": 0.34657078981399536, "learning_rate": 7.825119989112173e-07, "loss": 1.0815, "step": 840 }, { "epoch": 0.8970976253298153, "grad_norm": 0.34550759196281433, "learning_rate": 6.458203917796546e-07, "loss": 1.0883, "step": 850 }, { "epoch": 0.9076517150395779, "grad_norm": 0.34100624918937683, "learning_rate": 5.218455615757601e-07, "loss": 1.0781, "step": 860 }, { "epoch": 0.9182058047493403, "grad_norm": 0.336028516292572, "learning_rate": 4.107560490295992e-07, "loss": 1.0716, "step": 870 }, { "epoch": 0.9287598944591029, "grad_norm": 0.35316023230552673, "learning_rate": 3.127028775990515e-07, "loss": 1.0755, "step": 880 }, { "epoch": 0.9393139841688655, "grad_norm": 0.3301040232181549, "learning_rate": 2.2781934815713224e-07, "loss": 1.0718, "step": 890 }, { "epoch": 0.9498680738786279, "grad_norm": 0.3545936048030853, "learning_rate": 1.562208577727442e-07, "loss": 1.0812, "step": 900 }, { "epoch": 0.9604221635883905, "grad_norm": 0.3564644455909729, "learning_rate": 9.800474283119143e-08, "loss": 1.0775, "step": 910 }, { "epoch": 0.9709762532981531, "grad_norm": 0.34894269704818726, "learning_rate": 5.325014670776951e-08, "loss": 1.0694, "step": 920 }, { "epoch": 0.9815303430079155, "grad_norm": 0.3846621811389923, "learning_rate": 2.201791217428917e-08, "loss": 1.0691, "step": 930 }, { "epoch": 0.9920844327176781, "grad_norm": 0.3404500186443329, "learning_rate": 4.3504986848297295e-09, "loss": 1.0701, "step": 940 }, { "epoch": 0.9994722955145119, "step": 947, "total_flos": 2.8182891025525637e+18, "train_loss": 1.100929617000608, "train_runtime": 11309.6924, "train_samples_per_second": 10.721, "train_steps_per_second": 0.084 } ], "logging_steps": 10, "max_steps": 947, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.8182891025525637e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }