64k_1.5B / trainer_state.json
Albus-Chen's picture
Initial upload of trained model
273c378 verified
Raw History Blame Contribute Delete
49.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01,
"grad_norm": 1.6595773696899414,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.8689,
"step": 10
},
{
"epoch": 0.02,
"grad_norm": 0.9993448853492737,
"learning_rate": 6.666666666666667e-06,
"loss": 0.7907,
"step": 20
},
{
"epoch": 0.03,
"grad_norm": 0.6807085275650024,
"learning_rate": 1e-05,
"loss": 0.7264,
"step": 30
},
{
"epoch": 0.04,
"grad_norm": 0.48878172039985657,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.6612,
"step": 40
},
{
"epoch": 0.05,
"grad_norm": 0.4423200190067291,
"learning_rate": 1.6666666666666667e-05,
"loss": 0.6629,
"step": 50
},
{
"epoch": 0.06,
"grad_norm": 0.4667101502418518,
"learning_rate": 2e-05,
"loss": 0.6387,
"step": 60
},
{
"epoch": 0.07,
"grad_norm": 0.46468427777290344,
"learning_rate": 2.3333333333333336e-05,
"loss": 0.638,
"step": 70
},
{
"epoch": 0.08,
"grad_norm": 0.5622338652610779,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.6268,
"step": 80
},
{
"epoch": 0.09,
"grad_norm": 0.5090572834014893,
"learning_rate": 3e-05,
"loss": 0.6268,
"step": 90
},
{
"epoch": 0.1,
"grad_norm": 0.6103790402412415,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.6204,
"step": 100
},
{
"epoch": 0.11,
"grad_norm": 0.6360691785812378,
"learning_rate": 3.6666666666666666e-05,
"loss": 0.6087,
"step": 110
},
{
"epoch": 0.12,
"grad_norm": 0.6564140319824219,
"learning_rate": 4e-05,
"loss": 0.6117,
"step": 120
},
{
"epoch": 0.13,
"grad_norm": 0.5885344743728638,
"learning_rate": 4.3333333333333334e-05,
"loss": 0.6034,
"step": 130
},
{
"epoch": 0.14,
"grad_norm": 0.5539721846580505,
"learning_rate": 4.666666666666667e-05,
"loss": 0.6068,
"step": 140
},
{
"epoch": 0.15,
"grad_norm": 0.4922417104244232,
"learning_rate": 5e-05,
"loss": 0.608,
"step": 150
},
{
"epoch": 0.16,
"grad_norm": 0.6012398600578308,
"learning_rate": 4.999848114735858e-05,
"loss": 0.5928,
"step": 160
},
{
"epoch": 0.17,
"grad_norm": 0.5108012557029724,
"learning_rate": 4.999392477398737e-05,
"loss": 0.5995,
"step": 170
},
{
"epoch": 0.18,
"grad_norm": 0.5281434655189514,
"learning_rate": 4.9986331433523156e-05,
"loss": 0.5824,
"step": 180
},
{
"epoch": 0.19,
"grad_norm": 0.7186631560325623,
"learning_rate": 4.997570204861915e-05,
"loss": 0.5867,
"step": 190
},
{
"epoch": 0.2,
"grad_norm": 0.4841364324092865,
"learning_rate": 4.996203791083291e-05,
"loss": 0.5866,
"step": 200
},
{
"epoch": 0.21,
"grad_norm": 0.5411853194236755,
"learning_rate": 4.994534068046937e-05,
"loss": 0.5944,
"step": 210
},
{
"epoch": 0.22,
"grad_norm": 0.4902998208999634,
"learning_rate": 4.992561238637912e-05,
"loss": 0.5863,
"step": 220
},
{
"epoch": 0.23,
"grad_norm": 0.4841536581516266,
"learning_rate": 4.9902855425711905e-05,
"loss": 0.5763,
"step": 230
},
{
"epoch": 0.24,
"grad_norm": 0.4989519715309143,
"learning_rate": 4.9877072563625285e-05,
"loss": 0.5884,
"step": 240
},
{
"epoch": 0.25,
"grad_norm": 0.4394078850746155,
"learning_rate": 4.984826693294874e-05,
"loss": 0.5895,
"step": 250
},
{
"epoch": 0.26,
"grad_norm": 0.4262292981147766,
"learning_rate": 4.981644203380291e-05,
"loss": 0.5758,
"step": 260
},
{
"epoch": 0.27,
"grad_norm": 0.530920684337616,
"learning_rate": 4.978160173317438e-05,
"loss": 0.5657,
"step": 270
},
{
"epoch": 0.28,
"grad_norm": 0.4573761522769928,
"learning_rate": 4.974375026444575e-05,
"loss": 0.5722,
"step": 280
},
{
"epoch": 0.29,
"grad_norm": 0.45514145493507385,
"learning_rate": 4.970289222688129e-05,
"loss": 0.5686,
"step": 290
},
{
"epoch": 0.3,
"grad_norm": 0.43139946460723877,
"learning_rate": 4.965903258506806e-05,
"loss": 0.5801,
"step": 300
},
{
"epoch": 0.31,
"grad_norm": 0.4548813998699188,
"learning_rate": 4.961217666831268e-05,
"loss": 0.5646,
"step": 310
},
{
"epoch": 0.32,
"grad_norm": 0.4365274906158447,
"learning_rate": 4.956233016999379e-05,
"loss": 0.5681,
"step": 320
},
{
"epoch": 0.33,
"grad_norm": 0.4180664122104645,
"learning_rate": 4.9509499146870236e-05,
"loss": 0.5617,
"step": 330
},
{
"epoch": 0.34,
"grad_norm": 0.5416036248207092,
"learning_rate": 4.9453690018345144e-05,
"loss": 0.5715,
"step": 340
},
{
"epoch": 0.35,
"grad_norm": 0.5843973159790039,
"learning_rate": 4.9394909565685894e-05,
"loss": 0.5773,
"step": 350
},
{
"epoch": 0.36,
"grad_norm": 0.47572824358940125,
"learning_rate": 4.933316493120015e-05,
"loss": 0.5673,
"step": 360
},
{
"epoch": 0.37,
"grad_norm": 0.37816718220710754,
"learning_rate": 4.9268463617368e-05,
"loss": 0.5689,
"step": 370
},
{
"epoch": 0.38,
"grad_norm": 0.43680626153945923,
"learning_rate": 4.9200813485930375e-05,
"loss": 0.5653,
"step": 380
},
{
"epoch": 0.39,
"grad_norm": 0.42846572399139404,
"learning_rate": 4.913022275693372e-05,
"loss": 0.5541,
"step": 390
},
{
"epoch": 0.4,
"grad_norm": 0.4237727224826813,
"learning_rate": 4.905670000773126e-05,
"loss": 0.5716,
"step": 400
},
{
"epoch": 0.41,
"grad_norm": 0.4714856743812561,
"learning_rate": 4.8980254171940746e-05,
"loss": 0.5579,
"step": 410
},
{
"epoch": 0.42,
"grad_norm": 0.4090372622013092,
"learning_rate": 4.8900894538358944e-05,
"loss": 0.5483,
"step": 420
},
{
"epoch": 0.43,
"grad_norm": 0.37138280272483826,
"learning_rate": 4.881863074983298e-05,
"loss": 0.5609,
"step": 430
},
{
"epoch": 0.44,
"grad_norm": 0.40046426653862,
"learning_rate": 4.8733472802088654e-05,
"loss": 0.5587,
"step": 440
},
{
"epoch": 0.45,
"grad_norm": 0.44308245182037354,
"learning_rate": 4.864543104251587e-05,
"loss": 0.5625,
"step": 450
},
{
"epoch": 0.46,
"grad_norm": 0.4166336953639984,
"learning_rate": 4.855451616891136e-05,
"loss": 0.5514,
"step": 460
},
{
"epoch": 0.47,
"grad_norm": 0.43248483538627625,
"learning_rate": 4.8460739228178806e-05,
"loss": 0.5496,
"step": 470
},
{
"epoch": 0.48,
"grad_norm": 0.4092395007610321,
"learning_rate": 4.8364111614986527e-05,
"loss": 0.5711,
"step": 480
},
{
"epoch": 0.49,
"grad_norm": 0.4332312345504761,
"learning_rate": 4.8264645070382964e-05,
"loss": 0.5539,
"step": 490
},
{
"epoch": 0.5,
"grad_norm": 0.3754676580429077,
"learning_rate": 4.8162351680370044e-05,
"loss": 0.5632,
"step": 500
},
{
"epoch": 0.51,
"grad_norm": 0.4241037964820862,
"learning_rate": 4.805724387443462e-05,
"loss": 0.559,
"step": 510
},
{
"epoch": 0.52,
"grad_norm": 0.4121766686439514,
"learning_rate": 4.7949334424038176e-05,
"loss": 0.5447,
"step": 520
},
{
"epoch": 0.53,
"grad_norm": 0.4240052402019501,
"learning_rate": 4.783863644106502e-05,
"loss": 0.5472,
"step": 530
},
{
"epoch": 0.54,
"grad_norm": 0.40223944187164307,
"learning_rate": 4.7725163376229064e-05,
"loss": 0.543,
"step": 540
},
{
"epoch": 0.55,
"grad_norm": 0.3641127049922943,
"learning_rate": 4.760892901743944e-05,
"loss": 0.5473,
"step": 550
},
{
"epoch": 0.56,
"grad_norm": 0.35558176040649414,
"learning_rate": 4.7489947488125175e-05,
"loss": 0.56,
"step": 560
},
{
"epoch": 0.57,
"grad_norm": 0.3903762698173523,
"learning_rate": 4.736823324551909e-05,
"loss": 0.5438,
"step": 570
},
{
"epoch": 0.58,
"grad_norm": 0.44032081961631775,
"learning_rate": 4.7243801078901084e-05,
"loss": 0.5386,
"step": 580
},
{
"epoch": 0.59,
"grad_norm": 0.4052445590496063,
"learning_rate": 4.711666610780115e-05,
"loss": 0.5477,
"step": 590
},
{
"epoch": 0.6,
"grad_norm": 0.4153045415878296,
"learning_rate": 4.698684378016222e-05,
"loss": 0.5389,
"step": 600
},
{
"epoch": 0.61,
"grad_norm": 0.4308865964412689,
"learning_rate": 4.685434987046314e-05,
"loss": 0.5476,
"step": 610
},
{
"epoch": 0.62,
"grad_norm": 0.346862256526947,
"learning_rate": 4.671920047780186e-05,
"loss": 0.5376,
"step": 620
},
{
"epoch": 0.63,
"grad_norm": 0.3750888407230377,
"learning_rate": 4.6581412023939354e-05,
"loss": 0.5345,
"step": 630
},
{
"epoch": 0.64,
"grad_norm": 0.45309221744537354,
"learning_rate": 4.644100125130418e-05,
"loss": 0.5522,
"step": 640
},
{
"epoch": 0.65,
"grad_norm": 0.3813372552394867,
"learning_rate": 4.629798522095818e-05,
"loss": 0.5508,
"step": 650
},
{
"epoch": 0.66,
"grad_norm": 0.38959550857543945,
"learning_rate": 4.6152381310523387e-05,
"loss": 0.5338,
"step": 660
},
{
"epoch": 0.67,
"grad_norm": 0.42343777418136597,
"learning_rate": 4.600420721207053e-05,
"loss": 0.5505,
"step": 670
},
{
"epoch": 0.68,
"grad_norm": 0.3677447438240051,
"learning_rate": 4.585348092996925e-05,
"loss": 0.5373,
"step": 680
},
{
"epoch": 0.69,
"grad_norm": 0.3684931993484497,
"learning_rate": 4.5700220778700504e-05,
"loss": 0.534,
"step": 690
},
{
"epoch": 0.7,
"grad_norm": 0.38051334023475647,
"learning_rate": 4.554444538063113e-05,
"loss": 0.5217,
"step": 700
},
{
"epoch": 0.71,
"grad_norm": 0.34087464213371277,
"learning_rate": 4.538617366375112e-05,
"loss": 0.5308,
"step": 710
},
{
"epoch": 0.72,
"grad_norm": 0.33237457275390625,
"learning_rate": 4.522542485937369e-05,
"loss": 0.5276,
"step": 720
},
{
"epoch": 0.73,
"grad_norm": 0.3885173499584198,
"learning_rate": 4.5062218499798526e-05,
"loss": 0.5284,
"step": 730
},
{
"epoch": 0.74,
"grad_norm": 0.3453039228916168,
"learning_rate": 4.4896574415938465e-05,
"loss": 0.5285,
"step": 740
},
{
"epoch": 0.75,
"grad_norm": 0.3653467297554016,
"learning_rate": 4.4728512734909844e-05,
"loss": 0.5313,
"step": 750
},
{
"epoch": 0.76,
"grad_norm": 0.3787703216075897,
"learning_rate": 4.455805387758691e-05,
"loss": 0.5446,
"step": 760
},
{
"epoch": 0.77,
"grad_norm": 0.39782479405403137,
"learning_rate": 4.438521855612054e-05,
"loss": 0.5436,
"step": 770
},
{
"epoch": 0.78,
"grad_norm": 0.38179811835289,
"learning_rate": 4.421002777142148e-05,
"loss": 0.5437,
"step": 780
},
{
"epoch": 0.79,
"grad_norm": 0.3457494378089905,
"learning_rate": 4.4032502810608614e-05,
"loss": 0.5311,
"step": 790
},
{
"epoch": 0.8,
"grad_norm": 0.3753390610218048,
"learning_rate": 4.385266524442241e-05,
"loss": 0.5312,
"step": 800
},
{
"epoch": 0.81,
"grad_norm": 0.3381490707397461,
"learning_rate": 4.367053692460385e-05,
"loss": 0.5162,
"step": 810
},
{
"epoch": 0.82,
"grad_norm": 0.3567236363887787,
"learning_rate": 4.3486139981239304e-05,
"loss": 0.5386,
"step": 820
},
{
"epoch": 0.83,
"grad_norm": 0.34833648800849915,
"learning_rate": 4.3299496820071546e-05,
"loss": 0.5275,
"step": 830
},
{
"epoch": 0.84,
"grad_norm": 0.3650229871273041,
"learning_rate": 4.311063011977723e-05,
"loss": 0.5296,
"step": 840
},
{
"epoch": 0.85,
"grad_norm": 0.385339617729187,
"learning_rate": 4.2919562829211283e-05,
"loss": 0.5284,
"step": 850
},
{
"epoch": 0.86,
"grad_norm": 0.3674757778644562,
"learning_rate": 4.2726318164618435e-05,
"loss": 0.5346,
"step": 860
},
{
"epoch": 0.87,
"grad_norm": 0.3463813364505768,
"learning_rate": 4.2530919606812216e-05,
"loss": 0.5343,
"step": 870
},
{
"epoch": 0.88,
"grad_norm": 0.3939419388771057,
"learning_rate": 4.233339089832189e-05,
"loss": 0.5289,
"step": 880
},
{
"epoch": 0.89,
"grad_norm": 0.3567444086074829,
"learning_rate": 4.21337560405075e-05,
"loss": 0.5313,
"step": 890
},
{
"epoch": 0.9,
"grad_norm": 0.3429320752620697,
"learning_rate": 4.193203929064353e-05,
"loss": 0.5143,
"step": 900
},
{
"epoch": 0.91,
"grad_norm": 0.3867582082748413,
"learning_rate": 4.172826515897146e-05,
"loss": 0.528,
"step": 910
},
{
"epoch": 0.92,
"grad_norm": 0.3279944360256195,
"learning_rate": 4.152245840572153e-05,
"loss": 0.5239,
"step": 920
},
{
"epoch": 0.93,
"grad_norm": 0.35522711277008057,
"learning_rate": 4.131464403810422e-05,
"loss": 0.5395,
"step": 930
},
{
"epoch": 0.94,
"grad_norm": 0.32539644837379456,
"learning_rate": 4.110484730727161e-05,
"loss": 0.5289,
"step": 940
},
{
"epoch": 0.95,
"grad_norm": 0.36315691471099854,
"learning_rate": 4.089309370524921e-05,
"loss": 0.5134,
"step": 950
},
{
"epoch": 0.96,
"grad_norm": 0.38284584879875183,
"learning_rate": 4.067940896183843e-05,
"loss": 0.5174,
"step": 960
},
{
"epoch": 0.97,
"grad_norm": 0.3352174162864685,
"learning_rate": 4.046381904149024e-05,
"loss": 0.5234,
"step": 970
},
{
"epoch": 0.98,
"grad_norm": 0.35670560598373413,
"learning_rate": 4.024635014015023e-05,
"loss": 0.5159,
"step": 980
},
{
"epoch": 0.99,
"grad_norm": 0.4193209111690521,
"learning_rate": 4.002702868207563e-05,
"loss": 0.5254,
"step": 990
},
{
"epoch": 1.0,
"grad_norm": 0.33531010150909424,
"learning_rate": 3.9805881316624506e-05,
"loss": 0.5075,
"step": 1000
},
{
"epoch": 1.01,
"grad_norm": 0.34601059556007385,
"learning_rate": 3.9582934915017665e-05,
"loss": 0.4798,
"step": 1010
},
{
"epoch": 1.02,
"grad_norm": 0.3596339523792267,
"learning_rate": 3.935821656707359e-05,
"loss": 0.4755,
"step": 1020
},
{
"epoch": 1.03,
"grad_norm": 0.3714556097984314,
"learning_rate": 3.91317535779168e-05,
"loss": 0.4793,
"step": 1030
},
{
"epoch": 1.04,
"grad_norm": 0.4134692847728729,
"learning_rate": 3.890357346466001e-05,
"loss": 0.4663,
"step": 1040
},
{
"epoch": 1.05,
"grad_norm": 0.34835919737815857,
"learning_rate": 3.867370395306068e-05,
"loss": 0.476,
"step": 1050
},
{
"epoch": 1.06,
"grad_norm": 0.34882938861846924,
"learning_rate": 3.844217297415196e-05,
"loss": 0.4683,
"step": 1060
},
{
"epoch": 1.07,
"grad_norm": 0.42797595262527466,
"learning_rate": 3.8209008660848974e-05,
"loss": 0.4645,
"step": 1070
},
{
"epoch": 1.08,
"grad_norm": 0.32183897495269775,
"learning_rate": 3.797423934453038e-05,
"loss": 0.4766,
"step": 1080
},
{
"epoch": 1.09,
"grad_norm": 0.3546960651874542,
"learning_rate": 3.773789355159587e-05,
"loss": 0.4797,
"step": 1090
},
{
"epoch": 1.1,
"grad_norm": 0.36568915843963623,
"learning_rate": 3.7500000000000003e-05,
"loss": 0.4765,
"step": 1100
},
{
"epoch": 1.11,
"grad_norm": 0.3618831932544708,
"learning_rate": 3.726058759576271e-05,
"loss": 0.4688,
"step": 1110
},
{
"epoch": 1.12,
"grad_norm": 0.3192635178565979,
"learning_rate": 3.7019685429456986e-05,
"loss": 0.4686,
"step": 1120
},
{
"epoch": 1.13,
"grad_norm": 0.3199959993362427,
"learning_rate": 3.6777322772674186e-05,
"loss": 0.4766,
"step": 1130
},
{
"epoch": 1.1400000000000001,
"grad_norm": 0.34484583139419556,
"learning_rate": 3.65335290744672e-05,
"loss": 0.4779,
"step": 1140
},
{
"epoch": 1.15,
"grad_norm": 0.32886865735054016,
"learning_rate": 3.628833395777224e-05,
"loss": 0.4758,
"step": 1150
},
{
"epoch": 1.16,
"grad_norm": 0.350413978099823,
"learning_rate": 3.604176721580935e-05,
"loss": 0.4755,
"step": 1160
},
{
"epoch": 1.17,
"grad_norm": 0.3193204700946808,
"learning_rate": 3.579385880846232e-05,
"loss": 0.4616,
"step": 1170
},
{
"epoch": 1.18,
"grad_norm": 0.3464047610759735,
"learning_rate": 3.5544638858638304e-05,
"loss": 0.478,
"step": 1180
},
{
"epoch": 1.19,
"grad_norm": 0.37507447600364685,
"learning_rate": 3.5294137648607625e-05,
"loss": 0.4776,
"step": 1190
},
{
"epoch": 1.2,
"grad_norm": 0.33693036437034607,
"learning_rate": 3.504238561632424e-05,
"loss": 0.4636,
"step": 1200
},
{
"epoch": 1.21,
"grad_norm": 0.32532545924186707,
"learning_rate": 3.478941335172729e-05,
"loss": 0.47,
"step": 1210
},
{
"epoch": 1.22,
"grad_norm": 0.36955147981643677,
"learning_rate": 3.453525159302415e-05,
"loss": 0.4854,
"step": 1220
},
{
"epoch": 1.23,
"grad_norm": 0.3343319296836853,
"learning_rate": 3.427993122295552e-05,
"loss": 0.4865,
"step": 1230
},
{
"epoch": 1.24,
"grad_norm": 0.3173106908798218,
"learning_rate": 3.4023483265042874e-05,
"loss": 0.4691,
"step": 1240
},
{
"epoch": 1.25,
"grad_norm": 0.3691994845867157,
"learning_rate": 3.376593887981887e-05,
"loss": 0.4821,
"step": 1250
},
{
"epoch": 1.26,
"grad_norm": 0.4036237597465515,
"learning_rate": 3.350732936104108e-05,
"loss": 0.4702,
"step": 1260
},
{
"epoch": 1.27,
"grad_norm": 0.32201361656188965,
"learning_rate": 3.3247686131889574e-05,
"loss": 0.4678,
"step": 1270
},
{
"epoch": 1.28,
"grad_norm": 0.33225005865097046,
"learning_rate": 3.29870407411487e-05,
"loss": 0.478,
"step": 1280
},
{
"epoch": 1.29,
"grad_norm": 0.3761782944202423,
"learning_rate": 3.272542485937369e-05,
"loss": 0.4708,
"step": 1290
},
{
"epoch": 1.3,
"grad_norm": 0.34827953577041626,
"learning_rate": 3.246287027504237e-05,
"loss": 0.4662,
"step": 1300
},
{
"epoch": 1.31,
"grad_norm": 0.34097573161125183,
"learning_rate": 3.2199408890692655e-05,
"loss": 0.4713,
"step": 1310
},
{
"epoch": 1.32,
"grad_norm": 0.361167311668396,
"learning_rate": 3.1935072719046115e-05,
"loss": 0.4712,
"step": 1320
},
{
"epoch": 1.33,
"grad_norm": 0.3238449990749359,
"learning_rate": 3.1669893879118156e-05,
"loss": 0.4698,
"step": 1330
},
{
"epoch": 1.34,
"grad_norm": 0.33388492465019226,
"learning_rate": 3.140390459231528e-05,
"loss": 0.4682,
"step": 1340
},
{
"epoch": 1.35,
"grad_norm": 0.3103346526622772,
"learning_rate": 3.1137137178519985e-05,
"loss": 0.4789,
"step": 1350
},
{
"epoch": 1.3599999999999999,
"grad_norm": 0.3352946639060974,
"learning_rate": 3.086962405216353e-05,
"loss": 0.4731,
"step": 1360
},
{
"epoch": 1.37,
"grad_norm": 0.31056320667266846,
"learning_rate": 3.06013977182874e-05,
"loss": 0.4668,
"step": 1370
},
{
"epoch": 1.38,
"grad_norm": 0.5738754868507385,
"learning_rate": 3.0332490768593675e-05,
"loss": 0.4633,
"step": 1380
},
{
"epoch": 1.3900000000000001,
"grad_norm": 0.3080455958843231,
"learning_rate": 3.0062935877484804e-05,
"loss": 0.4842,
"step": 1390
},
{
"epoch": 1.4,
"grad_norm": 0.3119259476661682,
"learning_rate": 2.9792765798093465e-05,
"loss": 0.4832,
"step": 1400
},
{
"epoch": 1.41,
"grad_norm": 0.34111911058425903,
"learning_rate": 2.952201335830275e-05,
"loss": 0.4726,
"step": 1410
},
{
"epoch": 1.42,
"grad_norm": 0.35389259457588196,
"learning_rate": 2.925071145675733e-05,
"loss": 0.4744,
"step": 1420
},
{
"epoch": 1.43,
"grad_norm": 0.3371218740940094,
"learning_rate": 2.8978893058865987e-05,
"loss": 0.4618,
"step": 1430
},
{
"epoch": 1.44,
"grad_norm": 0.306376188993454,
"learning_rate": 2.870659119279605e-05,
"loss": 0.4965,
"step": 1440
},
{
"epoch": 1.45,
"grad_norm": 0.33145007491111755,
"learning_rate": 2.8433838945460205e-05,
"loss": 0.4778,
"step": 1450
},
{
"epoch": 1.46,
"grad_norm": 0.3250512480735779,
"learning_rate": 2.8160669458496158e-05,
"loss": 0.4759,
"step": 1460
},
{
"epoch": 1.47,
"grad_norm": 0.3200785219669342,
"learning_rate": 2.788711592423966e-05,
"loss": 0.4714,
"step": 1470
},
{
"epoch": 1.48,
"grad_norm": 0.3664354979991913,
"learning_rate": 2.761321158169134e-05,
"loss": 0.4634,
"step": 1480
},
{
"epoch": 1.49,
"grad_norm": 0.33875763416290283,
"learning_rate": 2.7338989712477945e-05,
"loss": 0.473,
"step": 1490
},
{
"epoch": 1.5,
"grad_norm": 0.3120327293872833,
"learning_rate": 2.7064483636808313e-05,
"loss": 0.4601,
"step": 1500
},
{
"epoch": 1.51,
"grad_norm": 0.3270907700061798,
"learning_rate": 2.678972670942468e-05,
"loss": 0.469,
"step": 1510
},
{
"epoch": 1.52,
"grad_norm": 0.3123275339603424,
"learning_rate": 2.6514752315549847e-05,
"loss": 0.4643,
"step": 1520
},
{
"epoch": 1.53,
"grad_norm": 0.29727503657341003,
"learning_rate": 2.623959386683056e-05,
"loss": 0.4668,
"step": 1530
},
{
"epoch": 1.54,
"grad_norm": 0.3350415527820587,
"learning_rate": 2.5964284797277762e-05,
"loss": 0.4786,
"step": 1540
},
{
"epoch": 1.55,
"grad_norm": 0.31216147541999817,
"learning_rate": 2.5688858559204053e-05,
"loss": 0.4716,
"step": 1550
},
{
"epoch": 1.56,
"grad_norm": 0.33024659752845764,
"learning_rate": 2.5413348619158967e-05,
"loss": 0.4758,
"step": 1560
},
{
"epoch": 1.5699999999999998,
"grad_norm": 0.32393544912338257,
"learning_rate": 2.5137788453862515e-05,
"loss": 0.4742,
"step": 1570
},
{
"epoch": 1.58,
"grad_norm": 0.3421013057231903,
"learning_rate": 2.486221154613749e-05,
"loss": 0.4572,
"step": 1580
},
{
"epoch": 1.5899999999999999,
"grad_norm": 0.32907870411872864,
"learning_rate": 2.458665138084104e-05,
"loss": 0.4676,
"step": 1590
},
{
"epoch": 1.6,
"grad_norm": 0.31299474835395813,
"learning_rate": 2.4311141440795953e-05,
"loss": 0.4626,
"step": 1600
},
{
"epoch": 1.6099999999999999,
"grad_norm": 0.3338111340999603,
"learning_rate": 2.4035715202722237e-05,
"loss": 0.4606,
"step": 1610
},
{
"epoch": 1.62,
"grad_norm": 0.34725725650787354,
"learning_rate": 2.3760406133169443e-05,
"loss": 0.4647,
"step": 1620
},
{
"epoch": 1.63,
"grad_norm": 0.3239111602306366,
"learning_rate": 2.3485247684450166e-05,
"loss": 0.4605,
"step": 1630
},
{
"epoch": 1.6400000000000001,
"grad_norm": 0.3050364851951599,
"learning_rate": 2.3210273290575333e-05,
"loss": 0.4608,
"step": 1640
},
{
"epoch": 1.65,
"grad_norm": 0.3005702793598175,
"learning_rate": 2.2935516363191693e-05,
"loss": 0.4635,
"step": 1650
},
{
"epoch": 1.6600000000000001,
"grad_norm": 0.30899298191070557,
"learning_rate": 2.2661010287522057e-05,
"loss": 0.4674,
"step": 1660
},
{
"epoch": 1.67,
"grad_norm": 0.3082168698310852,
"learning_rate": 2.238678841830867e-05,
"loss": 0.4658,
"step": 1670
},
{
"epoch": 1.6800000000000002,
"grad_norm": 0.2973801791667938,
"learning_rate": 2.2112884075760347e-05,
"loss": 0.4678,
"step": 1680
},
{
"epoch": 1.69,
"grad_norm": 0.30037522315979004,
"learning_rate": 2.1839330541503845e-05,
"loss": 0.4607,
"step": 1690
},
{
"epoch": 1.7,
"grad_norm": 0.3158698081970215,
"learning_rate": 2.1566161054539798e-05,
"loss": 0.4631,
"step": 1700
},
{
"epoch": 1.71,
"grad_norm": 0.31011322140693665,
"learning_rate": 2.1293408807203947e-05,
"loss": 0.4633,
"step": 1710
},
{
"epoch": 1.72,
"grad_norm": 0.31316834688186646,
"learning_rate": 2.1021106941134012e-05,
"loss": 0.4679,
"step": 1720
},
{
"epoch": 1.73,
"grad_norm": 0.31946825981140137,
"learning_rate": 2.074928854324268e-05,
"loss": 0.4702,
"step": 1730
},
{
"epoch": 1.74,
"grad_norm": 0.2985219955444336,
"learning_rate": 2.047798664169726e-05,
"loss": 0.4664,
"step": 1740
},
{
"epoch": 1.75,
"grad_norm": 0.30881017446517944,
"learning_rate": 2.0207234201906547e-05,
"loss": 0.4601,
"step": 1750
},
{
"epoch": 1.76,
"grad_norm": 0.3028377890586853,
"learning_rate": 1.9937064122515202e-05,
"loss": 0.4737,
"step": 1760
},
{
"epoch": 1.77,
"grad_norm": 0.3166395127773285,
"learning_rate": 1.9667509231406334e-05,
"loss": 0.4567,
"step": 1770
},
{
"epoch": 1.78,
"grad_norm": 0.32097935676574707,
"learning_rate": 1.9398602281712604e-05,
"loss": 0.4627,
"step": 1780
},
{
"epoch": 1.79,
"grad_norm": 0.2962646186351776,
"learning_rate": 1.913037594783648e-05,
"loss": 0.4578,
"step": 1790
},
{
"epoch": 1.8,
"grad_norm": 0.3011949062347412,
"learning_rate": 1.8862862821480025e-05,
"loss": 0.4548,
"step": 1800
},
{
"epoch": 1.81,
"grad_norm": 0.31912025809288025,
"learning_rate": 1.859609540768471e-05,
"loss": 0.455,
"step": 1810
},
{
"epoch": 1.8199999999999998,
"grad_norm": 0.35504528880119324,
"learning_rate": 1.8330106120881846e-05,
"loss": 0.4662,
"step": 1820
},
{
"epoch": 1.83,
"grad_norm": 0.3003298342227936,
"learning_rate": 1.806492728095389e-05,
"loss": 0.4652,
"step": 1830
},
{
"epoch": 1.8399999999999999,
"grad_norm": 0.28152137994766235,
"learning_rate": 1.780059110930735e-05,
"loss": 0.4632,
"step": 1840
},
{
"epoch": 1.85,
"grad_norm": 0.3089231252670288,
"learning_rate": 1.7537129724957642e-05,
"loss": 0.456,
"step": 1850
},
{
"epoch": 1.8599999999999999,
"grad_norm": 0.28241249918937683,
"learning_rate": 1.7274575140626318e-05,
"loss": 0.4583,
"step": 1860
},
{
"epoch": 1.87,
"grad_norm": 0.3157854676246643,
"learning_rate": 1.70129592588513e-05,
"loss": 0.4564,
"step": 1870
},
{
"epoch": 1.88,
"grad_norm": 0.29856443405151367,
"learning_rate": 1.675231386811043e-05,
"loss": 0.4685,
"step": 1880
},
{
"epoch": 1.8900000000000001,
"grad_norm": 0.3080819249153137,
"learning_rate": 1.6492670638958924e-05,
"loss": 0.4696,
"step": 1890
},
{
"epoch": 1.9,
"grad_norm": 0.29385536909103394,
"learning_rate": 1.6234061120181142e-05,
"loss": 0.4633,
"step": 1900
},
{
"epoch": 1.9100000000000001,
"grad_norm": 0.30132725834846497,
"learning_rate": 1.5976516734957138e-05,
"loss": 0.455,
"step": 1910
},
{
"epoch": 1.92,
"grad_norm": 0.30257880687713623,
"learning_rate": 1.5720068777044476e-05,
"loss": 0.4551,
"step": 1920
},
{
"epoch": 1.9300000000000002,
"grad_norm": 0.30634188652038574,
"learning_rate": 1.5464748406975847e-05,
"loss": 0.4614,
"step": 1930
},
{
"epoch": 1.94,
"grad_norm": 0.3279210329055786,
"learning_rate": 1.521058664827272e-05,
"loss": 0.4588,
"step": 1940
},
{
"epoch": 1.95,
"grad_norm": 0.28984227776527405,
"learning_rate": 1.495761438367577e-05,
"loss": 0.4478,
"step": 1950
},
{
"epoch": 1.96,
"grad_norm": 0.2909398078918457,
"learning_rate": 1.4705862351392379e-05,
"loss": 0.4659,
"step": 1960
},
{
"epoch": 1.97,
"grad_norm": 0.3059076964855194,
"learning_rate": 1.44553611413617e-05,
"loss": 0.4586,
"step": 1970
},
{
"epoch": 1.98,
"grad_norm": 0.2801637351512909,
"learning_rate": 1.4206141191537682e-05,
"loss": 0.4589,
"step": 1980
},
{
"epoch": 1.99,
"grad_norm": 0.2810831367969513,
"learning_rate": 1.395823278419065e-05,
"loss": 0.4532,
"step": 1990
},
{
"epoch": 2.0,
"grad_norm": 0.33695289492607117,
"learning_rate": 1.3711666042227772e-05,
"loss": 0.4526,
"step": 2000
},
{
"epoch": 2.01,
"grad_norm": 0.33088284730911255,
"learning_rate": 1.346647092553281e-05,
"loss": 0.4157,
"step": 2010
},
{
"epoch": 2.02,
"grad_norm": 0.3108139932155609,
"learning_rate": 1.322267722732582e-05,
"loss": 0.4165,
"step": 2020
},
{
"epoch": 2.03,
"grad_norm": 0.3126479685306549,
"learning_rate": 1.2980314570543006e-05,
"loss": 0.4217,
"step": 2030
},
{
"epoch": 2.04,
"grad_norm": 0.30750831961631775,
"learning_rate": 1.2739412404237306e-05,
"loss": 0.4132,
"step": 2040
},
{
"epoch": 2.05,
"grad_norm": 0.30336615443229675,
"learning_rate": 1.2500000000000006e-05,
"loss": 0.4076,
"step": 2050
},
{
"epoch": 2.06,
"grad_norm": 0.27100318670272827,
"learning_rate": 1.2262106448404132e-05,
"loss": 0.407,
"step": 2060
},
{
"epoch": 2.07,
"grad_norm": 0.2856077253818512,
"learning_rate": 1.202576065546963e-05,
"loss": 0.4133,
"step": 2070
},
{
"epoch": 2.08,
"grad_norm": 0.28364866971969604,
"learning_rate": 1.1790991339151031e-05,
"loss": 0.4149,
"step": 2080
},
{
"epoch": 2.09,
"grad_norm": 0.3136128783226013,
"learning_rate": 1.1557827025848047e-05,
"loss": 0.4128,
"step": 2090
},
{
"epoch": 2.1,
"grad_norm": 0.33352553844451904,
"learning_rate": 1.1326296046939333e-05,
"loss": 0.4119,
"step": 2100
},
{
"epoch": 2.11,
"grad_norm": 0.27613121271133423,
"learning_rate": 1.1096426535339985e-05,
"loss": 0.412,
"step": 2110
},
{
"epoch": 2.12,
"grad_norm": 0.3114316463470459,
"learning_rate": 1.0868246422083204e-05,
"loss": 0.4144,
"step": 2120
},
{
"epoch": 2.13,
"grad_norm": 0.31617745757102966,
"learning_rate": 1.064178343292641e-05,
"loss": 0.4043,
"step": 2130
},
{
"epoch": 2.14,
"grad_norm": 0.3409804105758667,
"learning_rate": 1.0417065084982346e-05,
"loss": 0.4147,
"step": 2140
},
{
"epoch": 2.15,
"grad_norm": 0.331616073846817,
"learning_rate": 1.0194118683375503e-05,
"loss": 0.406,
"step": 2150
},
{
"epoch": 2.16,
"grad_norm": 0.3145408630371094,
"learning_rate": 9.972971317924374e-06,
"loss": 0.3991,
"step": 2160
},
{
"epoch": 2.17,
"grad_norm": 0.33192431926727295,
"learning_rate": 9.753649859849775e-06,
"loss": 0.4106,
"step": 2170
},
{
"epoch": 2.18,
"grad_norm": 0.3115055561065674,
"learning_rate": 9.536180958509768e-06,
"loss": 0.4096,
"step": 2180
},
{
"epoch": 2.19,
"grad_norm": 0.30449178814888,
"learning_rate": 9.320591038161574e-06,
"loss": 0.4091,
"step": 2190
},
{
"epoch": 2.2,
"grad_norm": 0.2961597740650177,
"learning_rate": 9.106906294750805e-06,
"loss": 0.3989,
"step": 2200
},
{
"epoch": 2.21,
"grad_norm": 0.3159533441066742,
"learning_rate": 8.895152692728397e-06,
"loss": 0.408,
"step": 2210
},
{
"epoch": 2.22,
"grad_norm": 0.3212539553642273,
"learning_rate": 8.685355961895784e-06,
"loss": 0.4135,
"step": 2220
},
{
"epoch": 2.23,
"grad_norm": 0.30796176195144653,
"learning_rate": 8.477541594278474e-06,
"loss": 0.4119,
"step": 2230
},
{
"epoch": 2.24,
"grad_norm": 0.3158734440803528,
"learning_rate": 8.271734841028553e-06,
"loss": 0.4064,
"step": 2240
},
{
"epoch": 2.25,
"grad_norm": 0.3129909038543701,
"learning_rate": 8.067960709356478e-06,
"loss": 0.42,
"step": 2250
},
{
"epoch": 2.26,
"grad_norm": 0.2892637848854065,
"learning_rate": 7.866243959492509e-06,
"loss": 0.4095,
"step": 2260
},
{
"epoch": 2.27,
"grad_norm": 0.2881993353366852,
"learning_rate": 7.666609101678121e-06,
"loss": 0.406,
"step": 2270
},
{
"epoch": 2.2800000000000002,
"grad_norm": 0.2821005582809448,
"learning_rate": 7.469080393187786e-06,
"loss": 0.4105,
"step": 2280
},
{
"epoch": 2.29,
"grad_norm": 0.289115846157074,
"learning_rate": 7.273681835381569e-06,
"loss": 0.4135,
"step": 2290
},
{
"epoch": 2.3,
"grad_norm": 0.30809682607650757,
"learning_rate": 7.080437170788723e-06,
"loss": 0.4088,
"step": 2300
},
{
"epoch": 2.31,
"grad_norm": 0.3143822252750397,
"learning_rate": 6.889369880222776e-06,
"loss": 0.4073,
"step": 2310
},
{
"epoch": 2.32,
"grad_norm": 0.3024907410144806,
"learning_rate": 6.700503179928458e-06,
"loss": 0.4081,
"step": 2320
},
{
"epoch": 2.33,
"grad_norm": 0.310665488243103,
"learning_rate": 6.513860018760698e-06,
"loss": 0.4142,
"step": 2330
},
{
"epoch": 2.34,
"grad_norm": 0.3210834264755249,
"learning_rate": 6.329463075396161e-06,
"loss": 0.4156,
"step": 2340
},
{
"epoch": 2.35,
"grad_norm": 0.30473592877388,
"learning_rate": 6.147334755577596e-06,
"loss": 0.4178,
"step": 2350
},
{
"epoch": 2.36,
"grad_norm": 0.2942945063114166,
"learning_rate": 5.967497189391386e-06,
"loss": 0.4016,
"step": 2360
},
{
"epoch": 2.37,
"grad_norm": 0.2914084792137146,
"learning_rate": 5.78997222857853e-06,
"loss": 0.4098,
"step": 2370
},
{
"epoch": 2.38,
"grad_norm": 0.30221128463745117,
"learning_rate": 5.614781443879463e-06,
"loss": 0.4058,
"step": 2380
},
{
"epoch": 2.39,
"grad_norm": 0.31281960010528564,
"learning_rate": 5.441946122413086e-06,
"loss": 0.4057,
"step": 2390
},
{
"epoch": 2.4,
"grad_norm": 0.2758500874042511,
"learning_rate": 5.271487265090163e-06,
"loss": 0.4118,
"step": 2400
},
{
"epoch": 2.41,
"grad_norm": 0.296254426240921,
"learning_rate": 5.103425584061538e-06,
"loss": 0.401,
"step": 2410
},
{
"epoch": 2.42,
"grad_norm": 0.2951298654079437,
"learning_rate": 4.937781500201474e-06,
"loss": 0.4003,
"step": 2420
},
{
"epoch": 2.43,
"grad_norm": 0.3158932030200958,
"learning_rate": 4.7745751406263165e-06,
"loss": 0.4169,
"step": 2430
},
{
"epoch": 2.44,
"grad_norm": 0.30102699995040894,
"learning_rate": 4.613826336248881e-06,
"loss": 0.4118,
"step": 2440
},
{
"epoch": 2.45,
"grad_norm": 0.2914685904979706,
"learning_rate": 4.4555546193688735e-06,
"loss": 0.409,
"step": 2450
},
{
"epoch": 2.46,
"grad_norm": 0.3147742748260498,
"learning_rate": 4.299779221299499e-06,
"loss": 0.4116,
"step": 2460
},
{
"epoch": 2.4699999999999998,
"grad_norm": 0.29551076889038086,
"learning_rate": 4.146519070030757e-06,
"loss": 0.4032,
"step": 2470
},
{
"epoch": 2.48,
"grad_norm": 0.2961500883102417,
"learning_rate": 3.995792787929481e-06,
"loss": 0.4049,
"step": 2480
},
{
"epoch": 2.49,
"grad_norm": 0.29260537028312683,
"learning_rate": 3.847618689476612e-06,
"loss": 0.4047,
"step": 2490
},
{
"epoch": 2.5,
"grad_norm": 0.2954242527484894,
"learning_rate": 3.7020147790418263e-06,
"loss": 0.4023,
"step": 2500
},
{
"epoch": 2.51,
"grad_norm": 0.3183572590351105,
"learning_rate": 3.5589987486958243e-06,
"loss": 0.4125,
"step": 2510
},
{
"epoch": 2.52,
"grad_norm": 0.30055201053619385,
"learning_rate": 3.418587976060653e-06,
"loss": 0.4166,
"step": 2520
},
{
"epoch": 2.5300000000000002,
"grad_norm": 0.29363346099853516,
"learning_rate": 3.280799522198144e-06,
"loss": 0.4143,
"step": 2530
},
{
"epoch": 2.54,
"grad_norm": 0.2946094870567322,
"learning_rate": 3.145650129536862e-06,
"loss": 0.4063,
"step": 2540
},
{
"epoch": 2.55,
"grad_norm": 0.3245265483856201,
"learning_rate": 3.013156219837776e-06,
"loss": 0.4066,
"step": 2550
},
{
"epoch": 2.56,
"grad_norm": 0.2841097414493561,
"learning_rate": 2.883333892198853e-06,
"loss": 0.4035,
"step": 2560
},
{
"epoch": 2.57,
"grad_norm": 0.27192243933677673,
"learning_rate": 2.7561989210989235e-06,
"loss": 0.4052,
"step": 2570
},
{
"epoch": 2.58,
"grad_norm": 0.2928083837032318,
"learning_rate": 2.6317667544809134e-06,
"loss": 0.4016,
"step": 2580
},
{
"epoch": 2.59,
"grad_norm": 0.2984160780906677,
"learning_rate": 2.510052511874822e-06,
"loss": 0.3986,
"step": 2590
},
{
"epoch": 2.6,
"grad_norm": 0.2815227806568146,
"learning_rate": 2.391070982560564e-06,
"loss": 0.402,
"step": 2600
},
{
"epoch": 2.61,
"grad_norm": 0.262170672416687,
"learning_rate": 2.2748366237709374e-06,
"loss": 0.4043,
"step": 2610
},
{
"epoch": 2.62,
"grad_norm": 0.2785099148750305,
"learning_rate": 2.1613635589349756e-06,
"loss": 0.4114,
"step": 2620
},
{
"epoch": 2.63,
"grad_norm": 0.293804407119751,
"learning_rate": 2.0506655759618244e-06,
"loss": 0.4166,
"step": 2630
},
{
"epoch": 2.64,
"grad_norm": 0.2911376357078552,
"learning_rate": 1.9427561255653816e-06,
"loss": 0.4082,
"step": 2640
},
{
"epoch": 2.65,
"grad_norm": 0.30202075839042664,
"learning_rate": 1.837648319629956e-06,
"loss": 0.4043,
"step": 2650
},
{
"epoch": 2.66,
"grad_norm": 0.317266047000885,
"learning_rate": 1.735354929617042e-06,
"loss": 0.415,
"step": 2660
},
{
"epoch": 2.67,
"grad_norm": 0.2760041058063507,
"learning_rate": 1.6358883850134816e-06,
"loss": 0.4119,
"step": 2670
},
{
"epoch": 2.68,
"grad_norm": 0.2752744257450104,
"learning_rate": 1.5392607718211994e-06,
"loss": 0.4044,
"step": 2680
},
{
"epoch": 2.69,
"grad_norm": 0.2895498275756836,
"learning_rate": 1.4454838310886425e-06,
"loss": 0.4076,
"step": 2690
},
{
"epoch": 2.7,
"grad_norm": 0.2708493769168854,
"learning_rate": 1.3545689574841342e-06,
"loss": 0.4023,
"step": 2700
},
{
"epoch": 2.71,
"grad_norm": 0.2823054790496826,
"learning_rate": 1.266527197911352e-06,
"loss": 0.403,
"step": 2710
},
{
"epoch": 2.7199999999999998,
"grad_norm": 0.2689080834388733,
"learning_rate": 1.1813692501670276e-06,
"loss": 0.407,
"step": 2720
},
{
"epoch": 2.73,
"grad_norm": 0.2879767417907715,
"learning_rate": 1.0991054616410589e-06,
"loss": 0.4087,
"step": 2730
},
{
"epoch": 2.74,
"grad_norm": 0.28133150935173035,
"learning_rate": 1.0197458280592542e-06,
"loss": 0.413,
"step": 2740
},
{
"epoch": 2.75,
"grad_norm": 0.31199556589126587,
"learning_rate": 9.432999922687396e-07,
"loss": 0.4006,
"step": 2750
},
{
"epoch": 2.76,
"grad_norm": 0.2973596751689911,
"learning_rate": 8.697772430662859e-07,
"loss": 0.3971,
"step": 2760
},
{
"epoch": 2.77,
"grad_norm": 0.28426092863082886,
"learning_rate": 7.991865140696331e-07,
"loss": 0.3985,
"step": 2770
},
{
"epoch": 2.7800000000000002,
"grad_norm": 0.3040194511413574,
"learning_rate": 7.315363826320005e-07,
"loss": 0.4136,
"step": 2780
},
{
"epoch": 2.79,
"grad_norm": 0.29921281337738037,
"learning_rate": 6.668350687998565e-07,
"loss": 0.3974,
"step": 2790
},
{
"epoch": 2.8,
"grad_norm": 0.2804381847381592,
"learning_rate": 6.050904343141095e-07,
"loss": 0.4149,
"step": 2800
},
{
"epoch": 2.81,
"grad_norm": 0.25890785455703735,
"learning_rate": 5.463099816548579e-07,
"loss": 0.4081,
"step": 2810
},
{
"epoch": 2.82,
"grad_norm": 0.29002565145492554,
"learning_rate": 4.905008531297661e-07,
"loss": 0.4105,
"step": 2820
},
{
"epoch": 2.83,
"grad_norm": 0.27962175011634827,
"learning_rate": 4.3766983000621266e-07,
"loss": 0.404,
"step": 2830
},
{
"epoch": 2.84,
"grad_norm": 0.3119331896305084,
"learning_rate": 3.8782333168732033e-07,
"loss": 0.4053,
"step": 2840
},
{
"epoch": 2.85,
"grad_norm": 0.29932940006256104,
"learning_rate": 3.4096741493194197e-07,
"loss": 0.4109,
"step": 2850
},
{
"epoch": 2.86,
"grad_norm": 0.28117814660072327,
"learning_rate": 2.9710777311871e-07,
"loss": 0.4116,
"step": 2860
},
{
"epoch": 2.87,
"grad_norm": 0.2876632511615753,
"learning_rate": 2.5624973555424815e-07,
"loss": 0.4029,
"step": 2870
},
{
"epoch": 2.88,
"grad_norm": 0.28768378496170044,
"learning_rate": 2.1839826682562015e-07,
"loss": 0.41,
"step": 2880
},
{
"epoch": 2.89,
"grad_norm": 0.29716014862060547,
"learning_rate": 1.8355796619708987e-07,
"loss": 0.4096,
"step": 2890
},
{
"epoch": 2.9,
"grad_norm": 0.3086964786052704,
"learning_rate": 1.517330670512629e-07,
"loss": 0.4061,
"step": 2900
},
{
"epoch": 2.91,
"grad_norm": 0.29135850071907043,
"learning_rate": 1.229274363747146e-07,
"loss": 0.4074,
"step": 2910
},
{
"epoch": 2.92,
"grad_norm": 0.2806086242198944,
"learning_rate": 9.71445742881022e-08,
"loss": 0.4172,
"step": 2920
},
{
"epoch": 2.93,
"grad_norm": 0.28173452615737915,
"learning_rate": 7.438761362087987e-08,
"loss": 0.4036,
"step": 2930
},
{
"epoch": 2.94,
"grad_norm": 0.2816000282764435,
"learning_rate": 5.4659319530636633e-08,
"loss": 0.4054,
"step": 2940
},
{
"epoch": 2.95,
"grad_norm": 0.28980112075805664,
"learning_rate": 3.796208916709565e-08,
"loss": 0.4147,
"step": 2950
},
{
"epoch": 2.96,
"grad_norm": 0.2769039273262024,
"learning_rate": 2.429795138085278e-08,
"loss": 0.3919,
"step": 2960
},
{
"epoch": 2.9699999999999998,
"grad_norm": 0.2771114110946655,
"learning_rate": 1.3668566476848777e-08,
"loss": 0.4115,
"step": 2970
},
{
"epoch": 2.98,
"grad_norm": 0.30404967069625854,
"learning_rate": 6.075226012636215e-09,
"loss": 0.4037,
"step": 2980
},
{
"epoch": 2.99,
"grad_norm": 0.26605767011642456,
"learning_rate": 1.5188526414244842e-09,
"loss": 0.418,
"step": 2990
},
{
"epoch": 3.0,
"grad_norm": 0.2867048978805542,
"learning_rate": 0.0,
"loss": 0.4038,
"step": 3000
},
{
"epoch": 3.0,
"step": 3000,
"total_flos": 1.5946996047134327e+19,
"train_loss": 0.4809082725048065,
"train_runtime": 188478.9372,
"train_samples_per_second": 1.019,
"train_steps_per_second": 0.016
}
],
"logging_steps": 10,
"max_steps": 3000,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.5946996047134327e+19,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}