Suprit
/

Zhongjing-LLaMA-reward-v1

Model card Files Files and versions Community

Suprit commited on Aug 16, 2023

Commit

8fa1e6e

•

1 Parent(s): 0124f6c

Upload 10 files

Browse files

zhongjing reward model

Files changed (10) hide show

adapter_config.json +17 -0
adapter_model.bin +3 -0
all_results.json +7 -0
finetuning_args.json +13 -0
train_results.json +7 -0
trainer_log.jsonl +22 -0
trainer_state.json +157 -0
training_args.bin +3 -0
training_loss.png +0 -0
value_head.bin +3 -0

adapter_config.json ADDED Viewed

	@@ -0,0 +1,17 @@

+{
+  "base_model_name_or_path": "/hy-tmp/Ziya-LLaMA-13B-v1",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "lora_alpha": 32.0,
+  "lora_dropout": 0.1,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2a533e443a5e2aeb4ff0e5d64576b70659497d73b9815cadf39ba3b54c2aa181
+size 26269517

all_results.json ADDED Viewed

	@@ -0,0 +1,7 @@

+{
+    "epoch": 9.67,
+    "train_loss": 0.6559816967357289,
+    "train_runtime": 11143.63,
+    "train_samples_per_second": 1.302,
+    "train_steps_per_second": 0.02
+}

finetuning_args.json ADDED Viewed

	@@ -0,0 +1,13 @@

+{
+  "finetuning_type": "lora",
+  "lora_alpha": 32.0,
+  "lora_dropout": 0.1,
+  "lora_rank": 8,
+  "lora_target": [
+    "q_proj",
+    "v_proj"
+  ],
+  "name_module_trainable": "mlp",
+  "num_hidden_layers": 32,
+  "num_layer_trainable": 3
+}

train_results.json ADDED Viewed

	@@ -0,0 +1,7 @@

+{
+    "epoch": 9.67,
+    "train_loss": 0.6559816967357289,
+    "train_runtime": 11143.63,
+    "train_samples_per_second": 1.302,
+    "train_steps_per_second": 0.02
+}

trainer_log.jsonl ADDED Viewed

	@@ -0,0 +1,22 @@

+{"current_steps": 10, "total_steps": 220, "loss": 0.6983, "reward": null, "learning_rate": 0.0006987161058019419, "epoch": 0.44, "percentage": 4.55, "elapsed_time": "0:08:38", "remaining_time": "3:01:32"}
+{"current_steps": 20, "total_steps": 220, "loss": 0.6882, "reward": null, "learning_rate": 0.0006909041709298167, "epoch": 0.88, "percentage": 9.09, "elapsed_time": "0:17:04", "remaining_time": "2:50:48"}
+{"current_steps": 30, "total_steps": 220, "loss": 0.688, "reward": null, "learning_rate": 0.0006761524102240084, "epoch": 1.32, "percentage": 13.64, "elapsed_time": "0:25:20", "remaining_time": "2:40:26"}
+{"current_steps": 40, "total_steps": 220, "loss": 0.9653, "reward": null, "learning_rate": 0.0006618522834659287, "epoch": 1.76, "percentage": 18.18, "elapsed_time": "0:34:00", "remaining_time": "2:33:03"}
+{"current_steps": 50, "total_steps": 220, "loss": 0.6844, "reward": null, "learning_rate": 0.0006360647222822923, "epoch": 2.2, "percentage": 22.73, "elapsed_time": "0:42:17", "remaining_time": "2:23:48"}
+{"current_steps": 60, "total_steps": 220, "loss": 0.7206, "reward": null, "learning_rate": 0.0006044537082955259, "epoch": 2.64, "percentage": 27.27, "elapsed_time": "0:50:50", "remaining_time": "2:15:33"}
+{"current_steps": 70, "total_steps": 220, "loss": 0.6859, "reward": null, "learning_rate": 0.0005676627505917628, "epoch": 3.08, "percentage": 31.82, "elapsed_time": "0:59:19", "remaining_time": "2:07:07"}
+{"current_steps": 80, "total_steps": 220, "loss": 0.6803, "reward": null, "learning_rate": 0.0005264408069734912, "epoch": 3.52, "percentage": 36.36, "elapsed_time": "1:07:45", "remaining_time": "1:58:34"}
+{"current_steps": 90, "total_steps": 220, "loss": 0.6876, "reward": null, "learning_rate": 0.00048162703733850993, "epoch": 3.96, "percentage": 40.91, "elapsed_time": "1:16:13", "remaining_time": "1:50:06"}
+{"current_steps": 100, "total_steps": 220, "loss": 0.672, "reward": null, "learning_rate": 0.0004341337208043474, "epoch": 4.4, "percentage": 45.45, "elapsed_time": "1:24:39", "remaining_time": "1:41:35"}
+{"current_steps": 110, "total_steps": 220, "loss": 0.6803, "reward": null, "learning_rate": 0.00038492768433622394, "epoch": 4.84, "percentage": 50.0, "elapsed_time": "1:33:09", "remaining_time": "1:33:09"}
+{"current_steps": 120, "total_steps": 220, "loss": 0.6804, "reward": null, "learning_rate": 0.0003350106209381392, "epoch": 5.27, "percentage": 54.55, "elapsed_time": "1:41:31", "remaining_time": "1:24:36"}
+{"current_steps": 130, "total_steps": 220, "loss": 0.6505, "reward": null, "learning_rate": 0.00028539869807195416, "epoch": 5.71, "percentage": 59.09, "elapsed_time": "1:50:02", "remaining_time": "1:16:11"}
+{"current_steps": 140, "total_steps": 220, "loss": 0.6645, "reward": null, "learning_rate": 0.00023710187141825318, "epoch": 6.15, "percentage": 63.64, "elapsed_time": "1:58:18", "remaining_time": "1:07:36"}
+{"current_steps": 150, "total_steps": 220, "loss": 0.6214, "reward": null, "learning_rate": 0.00019110332509115864, "epoch": 6.59, "percentage": 68.18, "elapsed_time": "2:06:59", "remaining_time": "0:59:15"}
+{"current_steps": 160, "total_steps": 220, "loss": 0.6356, "reward": null, "learning_rate": 0.00014833945684503654, "epoch": 7.03, "percentage": 72.73, "elapsed_time": "2:15:11", "remaining_time": "0:50:41"}
+{"current_steps": 170, "total_steps": 220, "loss": 0.5941, "reward": null, "learning_rate": 0.00010968081571656524, "epoch": 7.47, "percentage": 77.27, "elapsed_time": "2:23:43", "remaining_time": "0:42:16"}
+{"current_steps": 180, "total_steps": 220, "loss": 0.5754, "reward": null, "learning_rate": 7.591438015680559e-05, "epoch": 7.91, "percentage": 81.82, "elapsed_time": "2:32:13", "remaining_time": "0:33:49"}
+{"current_steps": 190, "total_steps": 220, "loss": 0.5813, "reward": null, "learning_rate": 4.7727537419395036e-05, "epoch": 8.35, "percentage": 86.36, "elapsed_time": "2:40:41", "remaining_time": "0:25:22"}
+{"current_steps": 200, "total_steps": 220, "loss": 0.5361, "reward": null, "learning_rate": 2.5694090338324998e-05, "epoch": 8.79, "percentage": 90.91, "elapsed_time": "2:49:07", "remaining_time": "0:16:54"}
+{"current_steps": 210, "total_steps": 220, "loss": 0.5233, "reward": null, "learning_rate": 1.0262576356951625e-05, "epoch": 9.23, "percentage": 95.45, "elapsed_time": "2:57:21", "remaining_time": "0:08:26"}
+{"current_steps": 220, "total_steps": 220, "loss": 0.5181, "reward": null, "learning_rate": 1.7471365991241382e-06, "epoch": 9.67, "percentage": 100.0, "elapsed_time": "3:05:51", "remaining_time": "0:00:00"}

trainer_state.json ADDED Viewed

	@@ -0,0 +1,157 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 9.67032967032967,
+  "global_step": 220,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.44,
+      "learning_rate": 0.0006987161058019419,
+      "loss": 0.6983,
+      "step": 10
+    },
+    {
+      "epoch": 0.88,
+      "learning_rate": 0.0006909041709298167,
+      "loss": 0.6882,
+      "step": 20
+    },
+    {
+      "epoch": 1.32,
+      "learning_rate": 0.0006761524102240084,
+      "loss": 0.688,
+      "step": 30
+    },
+    {
+      "epoch": 1.76,
+      "learning_rate": 0.0006618522834659287,
+      "loss": 0.9653,
+      "step": 40
+    },
+    {
+      "epoch": 2.2,
+      "learning_rate": 0.0006360647222822923,
+      "loss": 0.6844,
+      "step": 50
+    },
+    {
+      "epoch": 2.64,
+      "learning_rate": 0.0006044537082955259,
+      "loss": 0.7206,
+      "step": 60
+    },
+    {
+      "epoch": 3.08,
+      "learning_rate": 0.0005676627505917628,
+      "loss": 0.6859,
+      "step": 70
+    },
+    {
+      "epoch": 3.52,
+      "learning_rate": 0.0005264408069734912,
+      "loss": 0.6803,
+      "step": 80
+    },
+    {
+      "epoch": 3.96,
+      "learning_rate": 0.00048162703733850993,
+      "loss": 0.6876,
+      "step": 90
+    },
+    {
+      "epoch": 4.4,
+      "learning_rate": 0.0004341337208043474,
+      "loss": 0.672,
+      "step": 100
+    },
+    {
+      "epoch": 4.84,
+      "learning_rate": 0.00038492768433622394,
+      "loss": 0.6803,
+      "step": 110
+    },
+    {
+      "epoch": 5.27,
+      "learning_rate": 0.0003350106209381392,
+      "loss": 0.6804,
+      "step": 120
+    },
+    {
+      "epoch": 5.71,
+      "learning_rate": 0.00028539869807195416,
+      "loss": 0.6505,
+      "step": 130
+    },
+    {
+      "epoch": 6.15,
+      "learning_rate": 0.00023710187141825318,
+      "loss": 0.6645,
+      "step": 140
+    },
+    {
+      "epoch": 6.59,
+      "learning_rate": 0.00019110332509115864,
+      "loss": 0.6214,
+      "step": 150
+    },
+    {
+      "epoch": 7.03,
+      "learning_rate": 0.00014833945684503654,
+      "loss": 0.6356,
+      "step": 160
+    },
+    {
+      "epoch": 7.47,
+      "learning_rate": 0.00010968081571656524,
+      "loss": 0.5941,
+      "step": 170
+    },
+    {
+      "epoch": 7.91,
+      "learning_rate": 7.591438015680559e-05,
+      "loss": 0.5754,
+      "step": 180
+    },
+    {
+      "epoch": 8.35,
+      "learning_rate": 4.7727537419395036e-05,
+      "loss": 0.5813,
+      "step": 190
+    },
+    {
+      "epoch": 8.79,
+      "learning_rate": 2.5694090338324998e-05,
+      "loss": 0.5361,
+      "step": 200
+    },
+    {
+      "epoch": 9.23,
+      "learning_rate": 1.0262576356951625e-05,
+      "loss": 0.5233,
+      "step": 210
+    },
+    {
+      "epoch": 9.67,
+      "learning_rate": 1.7471365991241382e-06,
+      "loss": 0.5181,
+      "step": 220
+    },
+    {
+      "epoch": 9.67,
+      "step": 220,
+      "total_flos": 0.0,
+      "train_loss": 0.6559816967357289,
+      "train_runtime": 11143.63,
+      "train_samples_per_second": 1.302,
+      "train_steps_per_second": 0.02
+    }
+  ],
+  "max_steps": 220,
+  "num_train_epochs": 10,
+  "total_flos": 0.0,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:dc5956f44bfde99c8ebe9bb481abd02e2ba3e19a283191698d44b72c86d833f1
+size 3363

training_loss.png ADDED Viewed

value_head.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:72bc7d2eab94d00ff621713cc857191d0de7b14b1a8bfb22cbae58ac38fa5a1d
+size 21491