Upload MistralForCausalLM

Browse files

Files changed (6) hide show

README.md +1 -1
config.json +1 -1
generation_config.json +3 -7
model-00001-of-00002.safetensors +2 -2
model-00002-of-00002.safetensors +2 -2
model.safetensors.index.json +41 -41

README.md CHANGED Viewed

@@ -1,8 +1,8 @@
 ---
 language:
 - en
-license: mit
 library_name: transformers
 tags:
 - unsloth
 - phi3

 ---
 language:
 - en
 library_name: transformers
+license: mit
 tags:
 - unsloth
 - phi3

config.json CHANGED Viewed

@@ -20,7 +20,7 @@
   "sliding_window": 2048,
   "tie_word_embeddings": false,
   "torch_dtype": "bfloat16",
-  "transformers_version": "4.41.0.dev0",
   "use_cache": true,
   "vocab_size": 32064
 }

   "sliding_window": 2048,
   "tie_word_embeddings": false,
   "torch_dtype": "bfloat16",
+  "transformers_version": "4.43.0.dev0",
   "use_cache": true,
   "vocab_size": 32064
 }

generation_config.json CHANGED Viewed

@@ -1,11 +1,7 @@
 {
   "_from_model_config": true,
   "bos_token_id": 1,
-  "eos_token_id": [
-    32000,
-    32001,
-    32007
-  ],
-  "pad_token_id": 32009,
-  "transformers_version": "4.41.0"
 }

 {
   "_from_model_config": true,
   "bos_token_id": 1,
+  "eos_token_id": 32000,
+  "pad_token_id": 32000,
+  "transformers_version": "4.43.0.dev0"
 }

model-00001-of-00002.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:56a30eb57dba0316d47563c10e56c2766c0ca8268bb9aeddc2cd6425b0eee18d
-size 3997254704

 version https://git-lfs.github.com/spec/v1
+oid sha256:3403fc7e50e4a23a265a54ee7c74c465be32dcf93371d5346d38b9a724f0546f
+size 4991370968

model-00002-of-00002.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:3fa1b757c69eb9a1ea2f14e41be77eb554f79378a0a450b343dc35848d820238
-size 3644938080

 version https://git-lfs.github.com/spec/v1
+oid sha256:79e3d00e5431b1b409d0222aea0daa244f715dc8a030b0dbc5e44be9b7353112
+size 2650821816

model.safetensors.index.json CHANGED Viewed

@@ -77,42 +77,42 @@
     "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.layers.16.input_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.16.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
-    "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
     "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.layers.17.input_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.input_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
@@ -122,23 +122,23 @@
     "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
-    "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
-    "model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
     "model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",

     "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
     "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
     "model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
     "model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",