{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0786431865782295, "eval_steps": 3000, "global_step": 9000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00043690659210127495, "grad_norm": 1.8826903104782104, "learning_rate": 2.4500000000000003e-05, "loss": 9.762939453125, "step": 50 }, { "epoch": 0.0008738131842025499, "grad_norm": 0.9995923042297363, "learning_rate": 4.9500000000000004e-05, "loss": 8.305597534179688, "step": 100 }, { "epoch": 0.001310719776303825, "grad_norm": 0.9061496257781982, "learning_rate": 7.45e-05, "loss": 7.173495483398438, "step": 150 }, { "epoch": 0.0017476263684050998, "grad_norm": 1.6024847030639648, "learning_rate": 9.95e-05, "loss": 6.624603271484375, "step": 200 }, { "epoch": 0.002184532960506375, "grad_norm": 1.2123334407806396, "learning_rate": 0.0001245, "loss": 6.243399658203125, "step": 250 }, { "epoch": 0.00262143955260765, "grad_norm": 1.0432322025299072, "learning_rate": 0.0001495, "loss": 5.9879296875, "step": 300 }, { "epoch": 0.0030583461447089245, "grad_norm": 0.9280146360397339, "learning_rate": 0.00017449999999999999, "loss": 5.776607666015625, "step": 350 }, { "epoch": 0.0034952527368101996, "grad_norm": 1.0289900302886963, "learning_rate": 0.00019950000000000002, "loss": 5.5920703125, "step": 400 }, { "epoch": 0.003932159328911475, "grad_norm": 1.0593407154083252, "learning_rate": 0.0002245, "loss": 5.437271728515625, "step": 450 }, { "epoch": 0.00436906592101275, "grad_norm": 1.0122662782669067, "learning_rate": 0.0002495, "loss": 5.287777709960937, "step": 500 }, { "epoch": 0.004805972513114025, "grad_norm": 0.7662743926048279, "learning_rate": 0.0002745, "loss": 5.155453491210937, "step": 550 }, { "epoch": 0.0052428791052153, "grad_norm": 0.7941539287567139, "learning_rate": 0.0002995, "loss": 5.030631713867187, "step": 600 }, { "epoch": 0.005679785697316574, "grad_norm": 0.6195730566978455, "learning_rate": 0.00032450000000000003, "loss": 4.909389953613282, "step": 650 }, { "epoch": 0.006116692289417849, "grad_norm": 0.6587674617767334, "learning_rate": 0.0003495, "loss": 4.786273498535156, "step": 700 }, { "epoch": 0.006553598881519124, "grad_norm": 0.7233771681785583, "learning_rate": 0.0003745, "loss": 4.6648342895507815, "step": 750 }, { "epoch": 0.006990505473620399, "grad_norm": 0.5489601492881775, "learning_rate": 0.0003995, "loss": 4.555048522949218, "step": 800 }, { "epoch": 0.007427412065721674, "grad_norm": 0.6154086589813232, "learning_rate": 0.0004245, "loss": 4.461051330566407, "step": 850 }, { "epoch": 0.00786431865782295, "grad_norm": 0.41333407163619995, "learning_rate": 0.00044950000000000003, "loss": 4.374936828613281, "step": 900 }, { "epoch": 0.008301225249924224, "grad_norm": 0.5036063194274902, "learning_rate": 0.0004745, "loss": 4.3033209228515625, "step": 950 }, { "epoch": 0.0087381318420255, "grad_norm": 0.3687891364097595, "learning_rate": 0.0004995, "loss": 4.233715209960938, "step": 1000 }, { "epoch": 0.009175038434126774, "grad_norm": 0.5433846116065979, "learning_rate": 0.0005245, "loss": 4.186253967285157, "step": 1050 }, { "epoch": 0.00961194502622805, "grad_norm": 0.439351350069046, "learning_rate": 0.0005495, "loss": 4.139383850097656, "step": 1100 }, { "epoch": 0.010048851618329325, "grad_norm": 0.36215880513191223, "learning_rate": 0.0005745, "loss": 4.08899658203125, "step": 1150 }, { "epoch": 0.0104857582104306, "grad_norm": 0.3970701992511749, "learning_rate": 0.0005995000000000001, "loss": 4.061238403320313, "step": 1200 }, { "epoch": 0.010922664802531873, "grad_norm": 0.3410918712615967, "learning_rate": 0.0006245000000000001, "loss": 4.026336669921875, "step": 1250 }, { "epoch": 0.011359571394633148, "grad_norm": 0.3047930598258972, "learning_rate": 0.0006495, "loss": 3.9928851318359375, "step": 1300 }, { "epoch": 0.011796477986734423, "grad_norm": 0.2819700241088867, "learning_rate": 0.0006745, "loss": 3.9584146118164063, "step": 1350 }, { "epoch": 0.012233384578835698, "grad_norm": 0.29095014929771423, "learning_rate": 0.0006995, "loss": 3.9291363525390626, "step": 1400 }, { "epoch": 0.012670291170936973, "grad_norm": 0.2987957298755646, "learning_rate": 0.0007245000000000001, "loss": 3.9090225219726564, "step": 1450 }, { "epoch": 0.013107197763038248, "grad_norm": 0.28419050574302673, "learning_rate": 0.0007495000000000001, "loss": 3.890744934082031, "step": 1500 }, { "epoch": 0.013544104355139523, "grad_norm": 0.3039053976535797, "learning_rate": 0.0007745, "loss": 3.861073303222656, "step": 1550 }, { "epoch": 0.013981010947240798, "grad_norm": 0.25676754117012024, "learning_rate": 0.0007995, "loss": 3.8428253173828124, "step": 1600 }, { "epoch": 0.014417917539342073, "grad_norm": 0.2573896646499634, "learning_rate": 0.0008245, "loss": 3.8260653686523436, "step": 1650 }, { "epoch": 0.014854824131443348, "grad_norm": 0.272127240896225, "learning_rate": 0.0008495000000000001, "loss": 3.8006341552734373, "step": 1700 }, { "epoch": 0.015291730723544623, "grad_norm": 0.23205944895744324, "learning_rate": 0.0008745000000000001, "loss": 3.7862649536132813, "step": 1750 }, { "epoch": 0.0157286373156459, "grad_norm": 0.22847425937652588, "learning_rate": 0.0008995, "loss": 3.771934814453125, "step": 1800 }, { "epoch": 0.016165543907747174, "grad_norm": 0.2651786208152771, "learning_rate": 0.0009245, "loss": 3.76009521484375, "step": 1850 }, { "epoch": 0.01660245049984845, "grad_norm": 0.24903950095176697, "learning_rate": 0.0009495, "loss": 3.7454238891601563, "step": 1900 }, { "epoch": 0.017039357091949724, "grad_norm": 0.24524764716625214, "learning_rate": 0.0009745000000000001, "loss": 3.735928955078125, "step": 1950 }, { "epoch": 0.017476263684051, "grad_norm": 0.22325558960437775, "learning_rate": 0.0009995000000000002, "loss": 3.7209417724609377, "step": 2000 }, { "epoch": 0.017913170276152274, "grad_norm": 0.23860357701778412, "learning_rate": 0.001, "loss": 3.7122769165039062, "step": 2050 }, { "epoch": 0.01835007686825355, "grad_norm": 0.2162218689918518, "learning_rate": 0.001, "loss": 3.690401611328125, "step": 2100 }, { "epoch": 0.018786983460354824, "grad_norm": 0.2171812504529953, "learning_rate": 0.001, "loss": 3.6825027465820312, "step": 2150 }, { "epoch": 0.0192238900524561, "grad_norm": 0.22677843272686005, "learning_rate": 0.001, "loss": 3.6679034423828125, "step": 2200 }, { "epoch": 0.019660796644557374, "grad_norm": 0.23934350907802582, "learning_rate": 0.001, "loss": 3.6494000244140623, "step": 2250 }, { "epoch": 0.02009770323665865, "grad_norm": 0.20819289982318878, "learning_rate": 0.001, "loss": 3.640907897949219, "step": 2300 }, { "epoch": 0.020534609828759924, "grad_norm": 0.22890810668468475, "learning_rate": 0.001, "loss": 3.6309326171875, "step": 2350 }, { "epoch": 0.0209715164208612, "grad_norm": 0.2085026353597641, "learning_rate": 0.001, "loss": 3.6261746215820314, "step": 2400 }, { "epoch": 0.021408423012962474, "grad_norm": 0.22136099636554718, "learning_rate": 0.001, "loss": 3.614878845214844, "step": 2450 }, { "epoch": 0.021845329605063746, "grad_norm": 0.21210630238056183, "learning_rate": 0.001, "loss": 3.599817810058594, "step": 2500 }, { "epoch": 0.02228223619716502, "grad_norm": 0.24638274312019348, "learning_rate": 0.001, "loss": 3.591536865234375, "step": 2550 }, { "epoch": 0.022719142789266296, "grad_norm": 0.20501184463500977, "learning_rate": 0.001, "loss": 3.58053955078125, "step": 2600 }, { "epoch": 0.02315604938136757, "grad_norm": 0.2101815640926361, "learning_rate": 0.001, "loss": 3.5824459838867186, "step": 2650 }, { "epoch": 0.023592955973468846, "grad_norm": 0.22906431555747986, "learning_rate": 0.001, "loss": 3.564821472167969, "step": 2700 }, { "epoch": 0.02402986256557012, "grad_norm": 0.20708167552947998, "learning_rate": 0.001, "loss": 3.5566305541992187, "step": 2750 }, { "epoch": 0.024466769157671396, "grad_norm": 0.21956811845302582, "learning_rate": 0.001, "loss": 3.5507748413085936, "step": 2800 }, { "epoch": 0.02490367574977267, "grad_norm": 0.24124488234519958, "learning_rate": 0.001, "loss": 3.5426095581054686, "step": 2850 }, { "epoch": 0.025340582341873946, "grad_norm": 0.20921742916107178, "learning_rate": 0.001, "loss": 3.531602783203125, "step": 2900 }, { "epoch": 0.02577748893397522, "grad_norm": 0.19601280987262726, "learning_rate": 0.001, "loss": 3.5225894165039064, "step": 2950 }, { "epoch": 0.026214395526076496, "grad_norm": 0.20243392884731293, "learning_rate": 0.001, "loss": 3.5183840942382814, "step": 3000 }, { "epoch": 0.026214395526076496, "eval_loss": 3.518667221069336, "eval_runtime": 5.8945, "eval_samples_per_second": 165.579, "eval_steps_per_second": 10.349, "step": 3000 }, { "epoch": 0.02665130211817777, "grad_norm": 0.1983480155467987, "learning_rate": 0.001, "loss": 3.5175689697265624, "step": 3050 }, { "epoch": 0.027088208710279046, "grad_norm": 0.20962044596672058, "learning_rate": 0.001, "loss": 3.501134033203125, "step": 3100 }, { "epoch": 0.02752511530238032, "grad_norm": 0.20161673426628113, "learning_rate": 0.001, "loss": 3.508039855957031, "step": 3150 }, { "epoch": 0.027962021894481597, "grad_norm": 0.21198803186416626, "learning_rate": 0.001, "loss": 3.493387451171875, "step": 3200 }, { "epoch": 0.02839892848658287, "grad_norm": 0.21940743923187256, "learning_rate": 0.001, "loss": 3.4941644287109375, "step": 3250 }, { "epoch": 0.028835835078684147, "grad_norm": 0.23343515396118164, "learning_rate": 0.001, "loss": 3.4835015869140626, "step": 3300 }, { "epoch": 0.02927274167078542, "grad_norm": 0.19761498272418976, "learning_rate": 0.001, "loss": 3.482951965332031, "step": 3350 }, { "epoch": 0.029709648262886697, "grad_norm": 0.22693106532096863, "learning_rate": 0.001, "loss": 3.475736389160156, "step": 3400 }, { "epoch": 0.030146554854987972, "grad_norm": 0.19969327747821808, "learning_rate": 0.001, "loss": 3.4689141845703126, "step": 3450 }, { "epoch": 0.030583461447089247, "grad_norm": 0.23987655341625214, "learning_rate": 0.001, "loss": 3.464185791015625, "step": 3500 }, { "epoch": 0.031020368039190522, "grad_norm": 0.20894227921962738, "learning_rate": 0.001, "loss": 3.4571575927734375, "step": 3550 }, { "epoch": 0.0314572746312918, "grad_norm": 0.22110916674137115, "learning_rate": 0.001, "loss": 3.4559121704101563, "step": 3600 }, { "epoch": 0.03189418122339307, "grad_norm": 0.21295017004013062, "learning_rate": 0.001, "loss": 3.451357421875, "step": 3650 }, { "epoch": 0.03233108781549435, "grad_norm": 0.19029361009597778, "learning_rate": 0.001, "loss": 3.4517440795898438, "step": 3700 }, { "epoch": 0.03276799440759562, "grad_norm": 0.2307061105966568, "learning_rate": 0.001, "loss": 3.4454116821289062, "step": 3750 }, { "epoch": 0.0332049009996969, "grad_norm": 0.2172439694404602, "learning_rate": 0.001, "loss": 3.4348458862304687, "step": 3800 }, { "epoch": 0.03364180759179817, "grad_norm": 0.19329442083835602, "learning_rate": 0.001, "loss": 3.437733154296875, "step": 3850 }, { "epoch": 0.03407871418389945, "grad_norm": 0.2241591513156891, "learning_rate": 0.001, "loss": 3.426455383300781, "step": 3900 }, { "epoch": 0.03451562077600072, "grad_norm": 0.2319568693637848, "learning_rate": 0.001, "loss": 3.433238830566406, "step": 3950 }, { "epoch": 0.034952527368102, "grad_norm": 0.1924877166748047, "learning_rate": 0.001, "loss": 3.4249606323242188, "step": 4000 }, { "epoch": 0.03538943396020327, "grad_norm": 0.2120707631111145, "learning_rate": 0.001, "loss": 3.421075439453125, "step": 4050 }, { "epoch": 0.03582634055230455, "grad_norm": 0.19918771088123322, "learning_rate": 0.001, "loss": 3.4203054809570315, "step": 4100 }, { "epoch": 0.03626324714440582, "grad_norm": 0.2003307044506073, "learning_rate": 0.001, "loss": 3.411707763671875, "step": 4150 }, { "epoch": 0.0367001537365071, "grad_norm": 0.2270653247833252, "learning_rate": 0.001, "loss": 3.4078097534179688, "step": 4200 }, { "epoch": 0.03713706032860837, "grad_norm": 0.21652576327323914, "learning_rate": 0.001, "loss": 3.4062127685546875, "step": 4250 }, { "epoch": 0.03757396692070965, "grad_norm": 0.23578432202339172, "learning_rate": 0.001, "loss": 3.400606689453125, "step": 4300 }, { "epoch": 0.03801087351281092, "grad_norm": 0.20475627481937408, "learning_rate": 0.001, "loss": 3.395752258300781, "step": 4350 }, { "epoch": 0.0384477801049122, "grad_norm": 0.2542702555656433, "learning_rate": 0.001, "loss": 3.396254577636719, "step": 4400 }, { "epoch": 0.03888468669701347, "grad_norm": 0.18298493325710297, "learning_rate": 0.001, "loss": 3.393648986816406, "step": 4450 }, { "epoch": 0.03932159328911475, "grad_norm": 0.22572273015975952, "learning_rate": 0.001, "loss": 3.3865216064453123, "step": 4500 }, { "epoch": 0.03975849988121602, "grad_norm": 0.19484151899814606, "learning_rate": 0.001, "loss": 3.3849478149414063, "step": 4550 }, { "epoch": 0.0401954064733173, "grad_norm": 0.19386635720729828, "learning_rate": 0.001, "loss": 3.38037109375, "step": 4600 }, { "epoch": 0.04063231306541857, "grad_norm": 0.20124493539333344, "learning_rate": 0.001, "loss": 3.382728271484375, "step": 4650 }, { "epoch": 0.04106921965751985, "grad_norm": 0.19963102042675018, "learning_rate": 0.001, "loss": 3.381324462890625, "step": 4700 }, { "epoch": 0.04150612624962112, "grad_norm": 0.20611299574375153, "learning_rate": 0.001, "loss": 3.3788223266601562, "step": 4750 }, { "epoch": 0.0419430328417224, "grad_norm": 0.19405238330364227, "learning_rate": 0.001, "loss": 3.3741259765625, "step": 4800 }, { "epoch": 0.04237993943382367, "grad_norm": 0.20914608240127563, "learning_rate": 0.001, "loss": 3.370547180175781, "step": 4850 }, { "epoch": 0.04281684602592495, "grad_norm": 0.19159191846847534, "learning_rate": 0.001, "loss": 3.3625115966796875, "step": 4900 }, { "epoch": 0.04325375261802622, "grad_norm": 0.19163894653320312, "learning_rate": 0.001, "loss": 3.360504455566406, "step": 4950 }, { "epoch": 0.04369065921012749, "grad_norm": 0.19763918220996857, "learning_rate": 0.001, "loss": 3.3601028442382814, "step": 5000 }, { "epoch": 0.04412756580222877, "grad_norm": 0.18974512815475464, "learning_rate": 0.001, "loss": 3.3579150390625, "step": 5050 }, { "epoch": 0.04456447239433004, "grad_norm": 0.21315094828605652, "learning_rate": 0.001, "loss": 3.355892333984375, "step": 5100 }, { "epoch": 0.04500137898643132, "grad_norm": 0.1904531568288803, "learning_rate": 0.001, "loss": 3.360745849609375, "step": 5150 }, { "epoch": 0.04543828557853259, "grad_norm": 0.19907866418361664, "learning_rate": 0.001, "loss": 3.357358703613281, "step": 5200 }, { "epoch": 0.04587519217063387, "grad_norm": 0.22703590989112854, "learning_rate": 0.001, "loss": 3.356294860839844, "step": 5250 }, { "epoch": 0.04631209876273514, "grad_norm": 0.1892520785331726, "learning_rate": 0.001, "loss": 3.3490374755859373, "step": 5300 }, { "epoch": 0.04674900535483642, "grad_norm": 0.18953296542167664, "learning_rate": 0.001, "loss": 3.3442022705078127, "step": 5350 }, { "epoch": 0.04718591194693769, "grad_norm": 0.1933782547712326, "learning_rate": 0.001, "loss": 3.3514590454101563, "step": 5400 }, { "epoch": 0.04762281853903897, "grad_norm": 0.22573590278625488, "learning_rate": 0.001, "loss": 3.3468975830078125, "step": 5450 }, { "epoch": 0.04805972513114024, "grad_norm": 0.2123604267835617, "learning_rate": 0.001, "loss": 3.3379788208007812, "step": 5500 }, { "epoch": 0.04849663172324152, "grad_norm": 0.18217475712299347, "learning_rate": 0.001, "loss": 3.344074401855469, "step": 5550 }, { "epoch": 0.04893353831534279, "grad_norm": 0.2128428965806961, "learning_rate": 0.001, "loss": 3.3349212646484374, "step": 5600 }, { "epoch": 0.04937044490744407, "grad_norm": 0.19785532355308533, "learning_rate": 0.001, "loss": 3.327950744628906, "step": 5650 }, { "epoch": 0.04980735149954534, "grad_norm": 0.18241338431835175, "learning_rate": 0.001, "loss": 3.334012451171875, "step": 5700 }, { "epoch": 0.05024425809164662, "grad_norm": 0.2020372748374939, "learning_rate": 0.001, "loss": 3.3329043579101563, "step": 5750 }, { "epoch": 0.05068116468374789, "grad_norm": 0.2071504294872284, "learning_rate": 0.001, "loss": 3.33412353515625, "step": 5800 }, { "epoch": 0.05111807127584917, "grad_norm": 0.20365303754806519, "learning_rate": 0.001, "loss": 3.322493591308594, "step": 5850 }, { "epoch": 0.05155497786795044, "grad_norm": 0.21742033958435059, "learning_rate": 0.001, "loss": 3.329978332519531, "step": 5900 }, { "epoch": 0.05199188446005172, "grad_norm": 0.18907567858695984, "learning_rate": 0.001, "loss": 3.328219299316406, "step": 5950 }, { "epoch": 0.05242879105215299, "grad_norm": 0.18905521929264069, "learning_rate": 0.001, "loss": 3.323075866699219, "step": 6000 }, { "epoch": 0.05242879105215299, "eval_loss": 3.3261899948120117, "eval_runtime": 6.1096, "eval_samples_per_second": 159.748, "eval_steps_per_second": 9.984, "step": 6000 }, { "epoch": 0.05286569764425427, "grad_norm": 0.19901056587696075, "learning_rate": 0.001, "loss": 3.3208355712890625, "step": 6050 }, { "epoch": 0.05330260423635554, "grad_norm": 0.19175691902637482, "learning_rate": 0.001, "loss": 3.3096588134765623, "step": 6100 }, { "epoch": 0.05373951082845682, "grad_norm": 0.20367567241191864, "learning_rate": 0.001, "loss": 3.318222961425781, "step": 6150 }, { "epoch": 0.05417641742055809, "grad_norm": 0.20697498321533203, "learning_rate": 0.001, "loss": 3.314552917480469, "step": 6200 }, { "epoch": 0.05461332401265937, "grad_norm": 0.23248012363910675, "learning_rate": 0.001, "loss": 3.312541809082031, "step": 6250 }, { "epoch": 0.05505023060476064, "grad_norm": 0.21030908823013306, "learning_rate": 0.001, "loss": 3.3117620849609377, "step": 6300 }, { "epoch": 0.05548713719686192, "grad_norm": 0.19639821350574493, "learning_rate": 0.001, "loss": 3.314966125488281, "step": 6350 }, { "epoch": 0.05592404378896319, "grad_norm": 0.1988273561000824, "learning_rate": 0.001, "loss": 3.308790588378906, "step": 6400 }, { "epoch": 0.05636095038106447, "grad_norm": 0.20665325224399567, "learning_rate": 0.001, "loss": 3.3096978759765623, "step": 6450 }, { "epoch": 0.05679785697316574, "grad_norm": 0.1974414736032486, "learning_rate": 0.001, "loss": 3.3091079711914064, "step": 6500 }, { "epoch": 0.057234763565267015, "grad_norm": 0.19521687924861908, "learning_rate": 0.001, "loss": 3.3086837768554687, "step": 6550 }, { "epoch": 0.05767167015736829, "grad_norm": 0.19938398897647858, "learning_rate": 0.001, "loss": 3.3038284301757814, "step": 6600 }, { "epoch": 0.058108576749469565, "grad_norm": 0.18721790611743927, "learning_rate": 0.001, "loss": 3.3031985473632814, "step": 6650 }, { "epoch": 0.05854548334157084, "grad_norm": 0.20039626955986023, "learning_rate": 0.001, "loss": 3.3011334228515623, "step": 6700 }, { "epoch": 0.058982389933672115, "grad_norm": 0.22351515293121338, "learning_rate": 0.001, "loss": 3.3007638549804685, "step": 6750 }, { "epoch": 0.059419296525773393, "grad_norm": 0.20300878584384918, "learning_rate": 0.001, "loss": 3.2940847778320315, "step": 6800 }, { "epoch": 0.059856203117874665, "grad_norm": 0.20710642635822296, "learning_rate": 0.001, "loss": 3.297225036621094, "step": 6850 }, { "epoch": 0.060293109709975944, "grad_norm": 0.1960466355085373, "learning_rate": 0.001, "loss": 3.2912692260742187, "step": 6900 }, { "epoch": 0.060730016302077215, "grad_norm": 0.1825372278690338, "learning_rate": 0.001, "loss": 3.2928152465820313, "step": 6950 }, { "epoch": 0.061166922894178494, "grad_norm": 0.19677802920341492, "learning_rate": 0.001, "loss": 3.2997564697265624, "step": 7000 }, { "epoch": 0.061603829486279765, "grad_norm": 0.21398645639419556, "learning_rate": 0.001, "loss": 3.293714904785156, "step": 7050 }, { "epoch": 0.062040736078381044, "grad_norm": 0.20046885311603546, "learning_rate": 0.001, "loss": 3.2939657592773437, "step": 7100 }, { "epoch": 0.062477642670482315, "grad_norm": 0.1991434544324875, "learning_rate": 0.001, "loss": 3.284585266113281, "step": 7150 }, { "epoch": 0.0629145492625836, "grad_norm": 0.20454499125480652, "learning_rate": 0.001, "loss": 3.2882635498046877, "step": 7200 }, { "epoch": 0.06335145585468487, "grad_norm": 0.20718543231487274, "learning_rate": 0.001, "loss": 3.283497619628906, "step": 7250 }, { "epoch": 0.06378836244678614, "grad_norm": 0.1971973031759262, "learning_rate": 0.001, "loss": 3.284901123046875, "step": 7300 }, { "epoch": 0.06422526903888742, "grad_norm": 0.18264292180538177, "learning_rate": 0.001, "loss": 3.285682373046875, "step": 7350 }, { "epoch": 0.0646621756309887, "grad_norm": 0.2100597620010376, "learning_rate": 0.001, "loss": 3.284263000488281, "step": 7400 }, { "epoch": 0.06509908222308997, "grad_norm": 0.19299328327178955, "learning_rate": 0.001, "loss": 3.283685302734375, "step": 7450 }, { "epoch": 0.06553598881519124, "grad_norm": 0.18712171912193298, "learning_rate": 0.001, "loss": 3.279105224609375, "step": 7500 }, { "epoch": 0.06597289540729252, "grad_norm": 0.18977321684360504, "learning_rate": 0.001, "loss": 3.287223205566406, "step": 7550 }, { "epoch": 0.0664098019993938, "grad_norm": 0.22269035875797272, "learning_rate": 0.001, "loss": 3.2770404052734374, "step": 7600 }, { "epoch": 0.06684670859149507, "grad_norm": 0.18847301602363586, "learning_rate": 0.001, "loss": 3.2692807006835936, "step": 7650 }, { "epoch": 0.06728361518359634, "grad_norm": 0.21769355237483978, "learning_rate": 0.001, "loss": 3.2741900634765626, "step": 7700 }, { "epoch": 0.06772052177569762, "grad_norm": 0.18970917165279388, "learning_rate": 0.001, "loss": 3.2736630249023437, "step": 7750 }, { "epoch": 0.0681574283677989, "grad_norm": 0.19735926389694214, "learning_rate": 0.001, "loss": 3.27821044921875, "step": 7800 }, { "epoch": 0.06859433495990017, "grad_norm": 0.19194583594799042, "learning_rate": 0.001, "loss": 3.2705389404296876, "step": 7850 }, { "epoch": 0.06903124155200144, "grad_norm": 0.2058054655790329, "learning_rate": 0.001, "loss": 3.2689944458007814, "step": 7900 }, { "epoch": 0.06946814814410272, "grad_norm": 0.18322297930717468, "learning_rate": 0.001, "loss": 3.2653887939453123, "step": 7950 }, { "epoch": 0.069905054736204, "grad_norm": 0.1952529400587082, "learning_rate": 0.001, "loss": 3.2640380859375, "step": 8000 }, { "epoch": 0.07034196132830527, "grad_norm": 0.1916273683309555, "learning_rate": 0.001, "loss": 3.274902648925781, "step": 8050 }, { "epoch": 0.07077886792040654, "grad_norm": 0.21100108325481415, "learning_rate": 0.001, "loss": 3.265535583496094, "step": 8100 }, { "epoch": 0.07121577451250782, "grad_norm": 0.2012566179037094, "learning_rate": 0.001, "loss": 3.2651483154296876, "step": 8150 }, { "epoch": 0.0716526811046091, "grad_norm": 0.1913347840309143, "learning_rate": 0.001, "loss": 3.2659671020507814, "step": 8200 }, { "epoch": 0.07208958769671037, "grad_norm": 0.19437524676322937, "learning_rate": 0.001, "loss": 3.268343811035156, "step": 8250 }, { "epoch": 0.07252649428881164, "grad_norm": 0.20302678644657135, "learning_rate": 0.001, "loss": 3.270460510253906, "step": 8300 }, { "epoch": 0.07296340088091291, "grad_norm": 0.1874990612268448, "learning_rate": 0.001, "loss": 3.2629928588867188, "step": 8350 }, { "epoch": 0.0734003074730142, "grad_norm": 0.19520102441310883, "learning_rate": 0.001, "loss": 3.265036315917969, "step": 8400 }, { "epoch": 0.07383721406511547, "grad_norm": 0.18731839954853058, "learning_rate": 0.001, "loss": 3.2578021240234376, "step": 8450 }, { "epoch": 0.07427412065721674, "grad_norm": 0.20026656985282898, "learning_rate": 0.001, "loss": 3.2632598876953125, "step": 8500 }, { "epoch": 0.07471102724931801, "grad_norm": 0.20248965919017792, "learning_rate": 0.001, "loss": 3.260670471191406, "step": 8550 }, { "epoch": 0.0751479338414193, "grad_norm": 0.20652979612350464, "learning_rate": 0.001, "loss": 3.2585479736328127, "step": 8600 }, { "epoch": 0.07558484043352057, "grad_norm": 0.18648388981819153, "learning_rate": 0.001, "loss": 3.259482727050781, "step": 8650 }, { "epoch": 0.07602174702562184, "grad_norm": 0.20123572647571564, "learning_rate": 0.001, "loss": 3.2517401123046876, "step": 8700 }, { "epoch": 0.07645865361772311, "grad_norm": 0.20070253312587738, "learning_rate": 0.001, "loss": 3.2553228759765624, "step": 8750 }, { "epoch": 0.0768955602098244, "grad_norm": 0.19734439253807068, "learning_rate": 0.001, "loss": 3.2518017578125, "step": 8800 }, { "epoch": 0.07733246680192567, "grad_norm": 0.2070627510547638, "learning_rate": 0.001, "loss": 3.251908874511719, "step": 8850 }, { "epoch": 0.07776937339402694, "grad_norm": 0.19075073301792145, "learning_rate": 0.001, "loss": 3.2540167236328124, "step": 8900 }, { "epoch": 0.07820627998612821, "grad_norm": 0.2121705412864685, "learning_rate": 0.001, "loss": 3.253029479980469, "step": 8950 }, { "epoch": 0.0786431865782295, "grad_norm": 0.21024636924266815, "learning_rate": 0.001, "loss": 3.2557443237304686, "step": 9000 }, { "epoch": 0.0786431865782295, "eval_loss": 3.257852554321289, "eval_runtime": 6.3455, "eval_samples_per_second": 153.811, "eval_steps_per_second": 9.613, "step": 9000 } ], "logging_steps": 50, "max_steps": 114440, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.069018836369408e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }