Training in progress, step 75, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +202 -3

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:0ab45aa988e6a9c84b8ca98631ddfe1a5c121434eeabc697ffd322ae9776fd50
 size 159967880

 version https://git-lfs.github.com/spec/v1
+oid sha256:94fc3cef370f490431ed1c5e986456245ce34b4b4c1c334d19ffa8e5e48deb7a
 size 159967880

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:cdd5f7749d0760109dde2f21e167c77485ede84e2f8b88e76abfb9ab4f2bc29d
 size 320194002

 version https://git-lfs.github.com/spec/v1
+oid sha256:837bda165dafca792898b682d37cd328e3cc838973e867dd3169e4a11c20de74
 size 320194002

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:a1402da9553ca434c2f6710d2d40e3b5eae193c866f0bef2eaccca39058993a1
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:b96fd3015aa4f507daff39a88b3149e32f8b490274439d7bb1f334bfbd1885a2
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:a89ffc445067fef9d6d02bb3ff9e61d5e3209e6fa67c7259b3b364b90dbaa2cd
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:f23e2214bcafb439ebc7528dcc283ef6218d509a276c0baff0743503ecbe3d92
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 0.008437394532568343,
   "eval_steps": 9,
-  "global_step": 50,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -405,6 +405,205 @@
       "learning_rate": 5.868240888334653e-05,
       "loss": 0.8999,
       "step": 50
     }
   ],
   "logging_steps": 1,
@@ -424,7 +623,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 4.197947642216448e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null

 {
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 0.012656091798852515,
   "eval_steps": 9,
+  "global_step": 75,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "learning_rate": 5.868240888334653e-05,
       "loss": 0.8999,
       "step": 50
+    },
+    {
+      "epoch": 0.00860614242321971,
+      "grad_norm": 0.22978180646896362,
+      "learning_rate": 5.695865504800327e-05,
+      "loss": 0.838,
+      "step": 51
+    },
+    {
+      "epoch": 0.008774890313871077,
+      "grad_norm": 0.2255326360464096,
+      "learning_rate": 5.522642316338268e-05,
+      "loss": 0.8183,
+      "step": 52
+    },
+    {
+      "epoch": 0.008943638204522443,
+      "grad_norm": 0.23889334499835968,
+      "learning_rate": 5.348782368720626e-05,
+      "loss": 0.7689,
+      "step": 53
+    },
+    {
+      "epoch": 0.00911238609517381,
+      "grad_norm": 0.23411183059215546,
+      "learning_rate": 5.174497483512506e-05,
+      "loss": 0.749,
+      "step": 54
+    },
+    {
+      "epoch": 0.00911238609517381,
+      "eval_loss": 0.7487614154815674,
+      "eval_runtime": 672.4672,
+      "eval_samples_per_second": 7.42,
+      "eval_steps_per_second": 0.928,
+      "step": 54
+    },
+    {
+      "epoch": 0.009281133985825177,
+      "grad_norm": 0.21135364472866058,
+      "learning_rate": 5e-05,
+      "loss": 0.6483,
+      "step": 55
+    },
+    {
+      "epoch": 0.009449881876476544,
+      "grad_norm": 0.22199489176273346,
+      "learning_rate": 4.825502516487497e-05,
+      "loss": 0.7055,
+      "step": 56
+    },
+    {
+      "epoch": 0.009618629767127912,
+      "grad_norm": 0.26034969091415405,
+      "learning_rate": 4.6512176312793736e-05,
+      "loss": 0.8685,
+      "step": 57
+    },
+    {
+      "epoch": 0.009787377657779277,
+      "grad_norm": 0.2556268870830536,
+      "learning_rate": 4.477357683661734e-05,
+      "loss": 0.8371,
+      "step": 58
+    },
+    {
+      "epoch": 0.009956125548430644,
+      "grad_norm": 0.23750770092010498,
+      "learning_rate": 4.3041344951996746e-05,
+      "loss": 0.8321,
+      "step": 59
+    },
+    {
+      "epoch": 0.010124873439082012,
+      "grad_norm": 0.25214332342147827,
+      "learning_rate": 4.131759111665349e-05,
+      "loss": 0.7922,
+      "step": 60
+    },
+    {
+      "epoch": 0.010293621329733379,
+      "grad_norm": 0.2333674132823944,
+      "learning_rate": 3.960441545911204e-05,
+      "loss": 0.7721,
+      "step": 61
+    },
+    {
+      "epoch": 0.010462369220384746,
+      "grad_norm": 0.2577410936355591,
+      "learning_rate": 3.790390522001662e-05,
+      "loss": 0.8861,
+      "step": 62
+    },
+    {
+      "epoch": 0.010631117111036112,
+      "grad_norm": 0.24156250059604645,
+      "learning_rate": 3.6218132209150045e-05,
+      "loss": 0.7453,
+      "step": 63
+    },
+    {
+      "epoch": 0.010631117111036112,
+      "eval_loss": 0.742745041847229,
+      "eval_runtime": 672.4867,
+      "eval_samples_per_second": 7.42,
+      "eval_steps_per_second": 0.928,
+      "step": 63
+    },
+    {
+      "epoch": 0.010799865001687479,
+      "grad_norm": 0.2269875854253769,
+      "learning_rate": 3.4549150281252636e-05,
+      "loss": 0.6588,
+      "step": 64
+    },
+    {
+      "epoch": 0.010968612892338846,
+      "grad_norm": 0.2180250734090805,
+      "learning_rate": 3.289899283371657e-05,
+      "loss": 0.7415,
+      "step": 65
+    },
+    {
+      "epoch": 0.011137360782990213,
+      "grad_norm": 0.2491016685962677,
+      "learning_rate": 3.12696703292044e-05,
+      "loss": 0.8364,
+      "step": 66
+    },
+    {
+      "epoch": 0.011306108673641579,
+      "grad_norm": 0.23741914331912994,
+      "learning_rate": 2.9663167846209998e-05,
+      "loss": 0.8251,
+      "step": 67
+    },
+    {
+      "epoch": 0.011474856564292946,
+      "grad_norm": 0.2304244041442871,
+      "learning_rate": 2.8081442660546125e-05,
+      "loss": 0.792,
+      "step": 68
+    },
+    {
+      "epoch": 0.011643604454944313,
+      "grad_norm": 0.2569412589073181,
+      "learning_rate": 2.6526421860705473e-05,
+      "loss": 0.6614,
+      "step": 69
+    },
+    {
+      "epoch": 0.01181235234559568,
+      "grad_norm": 0.20252695679664612,
+      "learning_rate": 2.500000000000001e-05,
+      "loss": 0.6474,
+      "step": 70
+    },
+    {
+      "epoch": 0.011981100236247048,
+      "grad_norm": 0.2276439368724823,
+      "learning_rate": 2.350403678833976e-05,
+      "loss": 0.7243,
+      "step": 71
+    },
+    {
+      "epoch": 0.012149848126898413,
+      "grad_norm": 0.28231948614120483,
+      "learning_rate": 2.2040354826462668e-05,
+      "loss": 0.7426,
+      "step": 72
+    },
+    {
+      "epoch": 0.012149848126898413,
+      "eval_loss": 0.7391621470451355,
+      "eval_runtime": 672.7088,
+      "eval_samples_per_second": 7.418,
+      "eval_steps_per_second": 0.928,
+      "step": 72
+    },
+    {
+      "epoch": 0.01231859601754978,
+      "grad_norm": 0.24270500242710114,
+      "learning_rate": 2.061073738537635e-05,
+      "loss": 0.6727,
+      "step": 73
+    },
+    {
+      "epoch": 0.012487343908201148,
+      "grad_norm": 0.24265378713607788,
+      "learning_rate": 1.9216926233717085e-05,
+      "loss": 0.6515,
+      "step": 74
+    },
+    {
+      "epoch": 0.012656091798852515,
+      "grad_norm": 0.23576249182224274,
+      "learning_rate": 1.7860619515673033e-05,
+      "loss": 0.8245,
+      "step": 75
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 6.181229992869888e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null