{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.3112033195020747,
  "eval_steps": 25,
  "global_step": 75,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.004149377593360996,
      "grad_norm": NaN,
      "learning_rate": 3.3333333333333335e-05,
      "loss": 0.0,
      "step": 1
    },
    {
      "epoch": 0.004149377593360996,
      "eval_loss": NaN,
      "eval_runtime": 21.8756,
      "eval_samples_per_second": 9.28,
      "eval_steps_per_second": 4.663,
      "step": 1
    },
    {
      "epoch": 0.008298755186721992,
      "grad_norm": NaN,
      "learning_rate": 6.666666666666667e-05,
      "loss": 0.0,
      "step": 2
    },
    {
      "epoch": 0.012448132780082987,
      "grad_norm": NaN,
      "learning_rate": 0.0001,
      "loss": 0.0,
      "step": 3
    },
    {
      "epoch": 0.016597510373443983,
      "grad_norm": NaN,
      "learning_rate": 9.99524110790929e-05,
      "loss": 0.0,
      "step": 4
    },
    {
      "epoch": 0.02074688796680498,
      "grad_norm": NaN,
      "learning_rate": 9.980973490458728e-05,
      "loss": 0.0,
      "step": 5
    },
    {
      "epoch": 0.024896265560165973,
      "grad_norm": NaN,
      "learning_rate": 9.957224306869053e-05,
      "loss": 0.0,
      "step": 6
    },
    {
      "epoch": 0.029045643153526972,
      "grad_norm": NaN,
      "learning_rate": 9.924038765061042e-05,
      "loss": 0.0,
      "step": 7
    },
    {
      "epoch": 0.03319502074688797,
      "grad_norm": NaN,
      "learning_rate": 9.881480035599667e-05,
      "loss": 0.0,
      "step": 8
    },
    {
      "epoch": 0.03734439834024896,
      "grad_norm": NaN,
      "learning_rate": 9.829629131445342e-05,
      "loss": 0.0,
      "step": 9
    },
    {
      "epoch": 0.04149377593360996,
      "grad_norm": NaN,
      "learning_rate": 9.768584753741134e-05,
      "loss": 0.0,
      "step": 10
    },
    {
      "epoch": 0.04564315352697095,
      "grad_norm": NaN,
      "learning_rate": 9.698463103929542e-05,
      "loss": 0.0,
      "step": 11
    },
    {
      "epoch": 0.04979253112033195,
      "grad_norm": NaN,
      "learning_rate": 9.619397662556435e-05,
      "loss": 0.0,
      "step": 12
    },
    {
      "epoch": 0.05394190871369295,
      "grad_norm": NaN,
      "learning_rate": 9.53153893518325e-05,
      "loss": 0.0,
      "step": 13
    },
    {
      "epoch": 0.058091286307053944,
      "grad_norm": NaN,
      "learning_rate": 9.435054165891109e-05,
      "loss": 0.0,
      "step": 14
    },
    {
      "epoch": 0.06224066390041494,
      "grad_norm": NaN,
      "learning_rate": 9.330127018922194e-05,
      "loss": 0.0,
      "step": 15
    },
    {
      "epoch": 0.06639004149377593,
      "grad_norm": NaN,
      "learning_rate": 9.21695722906443e-05,
      "loss": 0.0,
      "step": 16
    },
    {
      "epoch": 0.07053941908713693,
      "grad_norm": NaN,
      "learning_rate": 9.09576022144496e-05,
      "loss": 0.0,
      "step": 17
    },
    {
      "epoch": 0.07468879668049792,
      "grad_norm": NaN,
      "learning_rate": 8.966766701456177e-05,
      "loss": 0.0,
      "step": 18
    },
    {
      "epoch": 0.07883817427385892,
      "grad_norm": NaN,
      "learning_rate": 8.83022221559489e-05,
      "loss": 0.0,
      "step": 19
    },
    {
      "epoch": 0.08298755186721991,
      "grad_norm": NaN,
      "learning_rate": 8.68638668405062e-05,
      "loss": 0.0,
      "step": 20
    },
    {
      "epoch": 0.08713692946058091,
      "grad_norm": NaN,
      "learning_rate": 8.535533905932738e-05,
      "loss": 0.0,
      "step": 21
    },
    {
      "epoch": 0.0912863070539419,
      "grad_norm": NaN,
      "learning_rate": 8.377951038078302e-05,
      "loss": 0.0,
      "step": 22
    },
    {
      "epoch": 0.0954356846473029,
      "grad_norm": NaN,
      "learning_rate": 8.213938048432697e-05,
      "loss": 0.0,
      "step": 23
    },
    {
      "epoch": 0.0995850622406639,
      "grad_norm": NaN,
      "learning_rate": 8.043807145043604e-05,
      "loss": 0.0,
      "step": 24
    },
    {
      "epoch": 0.1037344398340249,
      "grad_norm": NaN,
      "learning_rate": 7.86788218175523e-05,
      "loss": 0.0,
      "step": 25
    },
    {
      "epoch": 0.1037344398340249,
      "eval_loss": NaN,
      "eval_runtime": 21.1222,
      "eval_samples_per_second": 9.611,
      "eval_steps_per_second": 4.829,
      "step": 25
    },
    {
      "epoch": 0.1078838174273859,
      "grad_norm": NaN,
      "learning_rate": 7.68649804173412e-05,
      "loss": 0.0,
      "step": 26
    },
    {
      "epoch": 0.11203319502074689,
      "grad_norm": NaN,
      "learning_rate": 7.500000000000001e-05,
      "loss": 0.0,
      "step": 27
    },
    {
      "epoch": 0.11618257261410789,
      "grad_norm": NaN,
      "learning_rate": 7.308743066175172e-05,
      "loss": 0.0,
      "step": 28
    },
    {
      "epoch": 0.12033195020746888,
      "grad_norm": NaN,
      "learning_rate": 7.113091308703498e-05,
      "loss": 0.0,
      "step": 29
    },
    {
      "epoch": 0.12448132780082988,
      "grad_norm": NaN,
      "learning_rate": 6.91341716182545e-05,
      "loss": 0.0,
      "step": 30
    },
    {
      "epoch": 0.12863070539419086,
      "grad_norm": NaN,
      "learning_rate": 6.710100716628344e-05,
      "loss": 0.0,
      "step": 31
    },
    {
      "epoch": 0.13278008298755187,
      "grad_norm": NaN,
      "learning_rate": 6.503528997521366e-05,
      "loss": 0.0,
      "step": 32
    },
    {
      "epoch": 0.13692946058091288,
      "grad_norm": NaN,
      "learning_rate": 6.294095225512603e-05,
      "loss": 0.0,
      "step": 33
    },
    {
      "epoch": 0.14107883817427386,
      "grad_norm": NaN,
      "learning_rate": 6.0821980696905146e-05,
      "loss": 0.0,
      "step": 34
    },
    {
      "epoch": 0.14522821576763487,
      "grad_norm": NaN,
      "learning_rate": 5.868240888334653e-05,
      "loss": 0.0,
      "step": 35
    },
    {
      "epoch": 0.14937759336099585,
      "grad_norm": NaN,
      "learning_rate": 5.6526309611002594e-05,
      "loss": 0.0,
      "step": 36
    },
    {
      "epoch": 0.15352697095435686,
      "grad_norm": NaN,
      "learning_rate": 5.435778713738292e-05,
      "loss": 0.0,
      "step": 37
    },
    {
      "epoch": 0.15767634854771784,
      "grad_norm": NaN,
      "learning_rate": 5.218096936826681e-05,
      "loss": 0.0,
      "step": 38
    },
    {
      "epoch": 0.16182572614107885,
      "grad_norm": NaN,
      "learning_rate": 5e-05,
      "loss": 0.0,
      "step": 39
    },
    {
      "epoch": 0.16597510373443983,
      "grad_norm": NaN,
      "learning_rate": 4.781903063173321e-05,
      "loss": 0.0,
      "step": 40
    },
    {
      "epoch": 0.17012448132780084,
      "grad_norm": NaN,
      "learning_rate": 4.564221286261709e-05,
      "loss": 0.0,
      "step": 41
    },
    {
      "epoch": 0.17427385892116182,
      "grad_norm": NaN,
      "learning_rate": 4.347369038899744e-05,
      "loss": 0.0,
      "step": 42
    },
    {
      "epoch": 0.17842323651452283,
      "grad_norm": NaN,
      "learning_rate": 4.131759111665349e-05,
      "loss": 0.0,
      "step": 43
    },
    {
      "epoch": 0.1825726141078838,
      "grad_norm": NaN,
      "learning_rate": 3.917801930309486e-05,
      "loss": 0.0,
      "step": 44
    },
    {
      "epoch": 0.18672199170124482,
      "grad_norm": NaN,
      "learning_rate": 3.705904774487396e-05,
      "loss": 0.0,
      "step": 45
    },
    {
      "epoch": 0.1908713692946058,
      "grad_norm": NaN,
      "learning_rate": 3.4964710024786354e-05,
      "loss": 0.0,
      "step": 46
    },
    {
      "epoch": 0.1950207468879668,
      "grad_norm": NaN,
      "learning_rate": 3.289899283371657e-05,
      "loss": 0.0,
      "step": 47
    },
    {
      "epoch": 0.1991701244813278,
      "grad_norm": NaN,
      "learning_rate": 3.086582838174551e-05,
      "loss": 0.0,
      "step": 48
    },
    {
      "epoch": 0.2033195020746888,
      "grad_norm": NaN,
      "learning_rate": 2.886908691296504e-05,
      "loss": 0.0,
      "step": 49
    },
    {
      "epoch": 0.2074688796680498,
      "grad_norm": NaN,
      "learning_rate": 2.6912569338248315e-05,
      "loss": 0.0,
      "step": 50
    },
    {
      "epoch": 0.2074688796680498,
      "eval_loss": NaN,
      "eval_runtime": 21.1259,
      "eval_samples_per_second": 9.609,
      "eval_steps_per_second": 4.828,
      "step": 50
    },
    {
      "epoch": 0.21161825726141079,
      "grad_norm": NaN,
      "learning_rate": 2.500000000000001e-05,
      "loss": 0.0,
      "step": 51
    },
    {
      "epoch": 0.2157676348547718,
      "grad_norm": NaN,
      "learning_rate": 2.3135019582658802e-05,
      "loss": 0.0,
      "step": 52
    },
    {
      "epoch": 0.21991701244813278,
      "grad_norm": NaN,
      "learning_rate": 2.132117818244771e-05,
      "loss": 0.0,
      "step": 53
    },
    {
      "epoch": 0.22406639004149378,
      "grad_norm": NaN,
      "learning_rate": 1.9561928549563968e-05,
      "loss": 0.0,
      "step": 54
    },
    {
      "epoch": 0.22821576763485477,
      "grad_norm": NaN,
      "learning_rate": 1.7860619515673033e-05,
      "loss": 0.0,
      "step": 55
    },
    {
      "epoch": 0.23236514522821577,
      "grad_norm": NaN,
      "learning_rate": 1.622048961921699e-05,
      "loss": 0.0,
      "step": 56
    },
    {
      "epoch": 0.23651452282157676,
      "grad_norm": NaN,
      "learning_rate": 1.4644660940672627e-05,
      "loss": 0.0,
      "step": 57
    },
    {
      "epoch": 0.24066390041493776,
      "grad_norm": NaN,
      "learning_rate": 1.3136133159493802e-05,
      "loss": 0.0,
      "step": 58
    },
    {
      "epoch": 0.24481327800829875,
      "grad_norm": NaN,
      "learning_rate": 1.1697777844051105e-05,
      "loss": 0.0,
      "step": 59
    },
    {
      "epoch": 0.24896265560165975,
      "grad_norm": NaN,
      "learning_rate": 1.0332332985438248e-05,
      "loss": 0.0,
      "step": 60
    },
    {
      "epoch": 0.25311203319502074,
      "grad_norm": NaN,
      "learning_rate": 9.042397785550405e-06,
      "loss": 0.0,
      "step": 61
    },
    {
      "epoch": 0.2572614107883817,
      "grad_norm": NaN,
      "learning_rate": 7.830427709355725e-06,
      "loss": 0.0,
      "step": 62
    },
    {
      "epoch": 0.26141078838174275,
      "grad_norm": NaN,
      "learning_rate": 6.698729810778065e-06,
      "loss": 0.0,
      "step": 63
    },
    {
      "epoch": 0.26556016597510373,
      "grad_norm": NaN,
      "learning_rate": 5.649458341088915e-06,
      "loss": 0.0,
      "step": 64
    },
    {
      "epoch": 0.2697095435684647,
      "grad_norm": NaN,
      "learning_rate": 4.684610648167503e-06,
      "loss": 0.0,
      "step": 65
    },
    {
      "epoch": 0.27385892116182575,
      "grad_norm": NaN,
      "learning_rate": 3.8060233744356633e-06,
      "loss": 0.0,
      "step": 66
    },
    {
      "epoch": 0.27800829875518673,
      "grad_norm": NaN,
      "learning_rate": 3.0153689607045845e-06,
      "loss": 0.0,
      "step": 67
    },
    {
      "epoch": 0.2821576763485477,
      "grad_norm": NaN,
      "learning_rate": 2.314152462588659e-06,
      "loss": 0.0,
      "step": 68
    },
    {
      "epoch": 0.2863070539419087,
      "grad_norm": NaN,
      "learning_rate": 1.70370868554659e-06,
      "loss": 0.0,
      "step": 69
    },
    {
      "epoch": 0.29045643153526973,
      "grad_norm": NaN,
      "learning_rate": 1.1851996440033319e-06,
      "loss": 0.0,
      "step": 70
    },
    {
      "epoch": 0.2946058091286307,
      "grad_norm": NaN,
      "learning_rate": 7.596123493895991e-07,
      "loss": 0.0,
      "step": 71
    },
    {
      "epoch": 0.2987551867219917,
      "grad_norm": NaN,
      "learning_rate": 4.277569313094809e-07,
      "loss": 0.0,
      "step": 72
    },
    {
      "epoch": 0.3029045643153527,
      "grad_norm": NaN,
      "learning_rate": 1.9026509541272275e-07,
      "loss": 0.0,
      "step": 73
    },
    {
      "epoch": 0.3070539419087137,
      "grad_norm": NaN,
      "learning_rate": 4.7588920907110094e-08,
      "loss": 0.0,
      "step": 74
    },
    {
      "epoch": 0.3112033195020747,
      "grad_norm": NaN,
      "learning_rate": 0.0,
      "loss": 0.0,
      "step": 75
    },
    {
      "epoch": 0.3112033195020747,
      "eval_loss": NaN,
      "eval_runtime": 21.1614,
      "eval_samples_per_second": 9.593,
      "eval_steps_per_second": 4.82,
      "step": 75
    }
  ],
  "logging_steps": 1,
  "max_steps": 75,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 1,
  "save_steps": 25,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 9.88845956923392e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}