Technotech commited on Jul 24, 2023

Commit

30b176a

1 Parent(s): fce1f0b

Initial upload

Browse files

Files changed (47) hide show

README.md +18 -1
adapter_config.json +21 -0
adapter_model.bin +3 -0
checkpoint-1140/README.md +20 -0
checkpoint-1140/adapter_config.json +21 -0
checkpoint-1140/adapter_model.bin +3 -0
checkpoint-1140/optimizer.pt +3 -0
checkpoint-1140/rng_state.pth +3 -0
checkpoint-1140/scheduler.pt +3 -0
checkpoint-1140/trainer_state.json +148 -0
checkpoint-1140/training_args.bin +3 -0
checkpoint-1170/README.md +20 -0
checkpoint-1170/adapter_config.json +21 -0
checkpoint-1170/adapter_model.bin +3 -0
checkpoint-1170/optimizer.pt +3 -0
checkpoint-1170/rng_state.pth +3 -0
checkpoint-1170/scheduler.pt +3 -0
checkpoint-1170/trainer_state.json +154 -0
checkpoint-1170/training_args.bin +3 -0
checkpoint-1200/README.md +20 -0
checkpoint-1200/adapter_config.json +21 -0
checkpoint-1200/adapter_model.bin +3 -0
checkpoint-1200/optimizer.pt +3 -0
checkpoint-1200/rng_state.pth +3 -0
checkpoint-1200/scheduler.pt +3 -0
checkpoint-1200/trainer_state.json +160 -0
checkpoint-1200/training_args.bin +3 -0
checkpoint-1230/README.md +20 -0
checkpoint-1230/adapter_config.json +21 -0
checkpoint-1230/adapter_model.bin +3 -0
checkpoint-1230/optimizer.pt +3 -0
checkpoint-1230/rng_state.pth +3 -0
checkpoint-1230/scheduler.pt +3 -0
checkpoint-1230/trainer_state.json +160 -0
checkpoint-1230/training_args.bin +3 -0
checkpoint-1260/README.md +20 -0
checkpoint-1260/adapter_config.json +21 -0
checkpoint-1260/adapter_model.bin +3 -0
checkpoint-1260/optimizer.pt +3 -0
checkpoint-1260/rng_state.pth +3 -0
checkpoint-1260/scheduler.pt +3 -0
checkpoint-1260/trainer_state.json +166 -0
checkpoint-1260/training_args.bin +3 -0
lora.zip +3 -0
runs/Jul24_13-30-25_1e592cd3bef2/events.out.tfevents.1690205426.1e592cd3bef2.140.0 +3 -0
runs/Jul24_13-32-17_1e592cd3bef2/events.out.tfevents.1690205538.1e592cd3bef2.185.0 +3 -0
trainer_state.json +175 -0

README.md CHANGED Viewed

@@ -1,3 +1,20 @@
 ---
-license: apache-2.0
 ---

 ---
+library_name: peft
 ---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e022fa8cdc7bc653f9644bde72f9ddcd8830487979104289ef35901753362e8d
+size 399137

checkpoint-1140/README.md ADDED Viewed

	@@ -0,0 +1,20 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

checkpoint-1140/adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-1140/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d909dc95705437534d125cdebe079a7e9c3e27efd8360dac47ee7e6748bc6554
+size 399137

checkpoint-1140/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ba7ac3e51c5e6fbcf7305df4ada2b232e6d75f391d612a0d7b929e9d18eba003
+size 800441

checkpoint-1140/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1784c9e20ffdc46b706882695c2108245d7626a328b6d70a37d079ad1fbbc989
+size 14575

checkpoint-1140/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3fc8fd1543b451b703d9b826913159ea6331680363ef7241dd3924cf46db8a8c
+size 627

checkpoint-1140/trainer_state.json ADDED Viewed

	@@ -0,0 +1,148 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.78125,
+  "global_step": 1140,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1681312938983424.0,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1140/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d5f26e97f1b0119d5c7b424eb78527d3e827728609abbb61280f6b4a8e9dc581
+size 3899

checkpoint-1170/README.md ADDED Viewed

	@@ -0,0 +1,20 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

checkpoint-1170/adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-1170/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:592853ea8ac946a7e85959377ef59fe2976ef60dc7132b618d8d4dde51910ce1
+size 399137

checkpoint-1170/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e2aea12e00c50124eeb2de87ed16fea8249588387019777dde5e63d37603dca8
+size 800441

checkpoint-1170/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1784c9e20ffdc46b706882695c2108245d7626a328b6d70a37d079ad1fbbc989
+size 14575

checkpoint-1170/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:abad2225bfa3230cf8da04adab5fb3785ca77402d7aa341a0d50b72d71c1eb17
+size 627

checkpoint-1170/trainer_state.json ADDED Viewed

	@@ -0,0 +1,154 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.828125,
+  "global_step": 1170,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    },
+    {
+      "epoch": 1.8,
+      "learning_rate": 0.0001,
+      "loss": 5.2537,
+      "step": 1150
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1723338082123776.0,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1170/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d5f26e97f1b0119d5c7b424eb78527d3e827728609abbb61280f6b4a8e9dc581
+size 3899

checkpoint-1200/README.md ADDED Viewed

	@@ -0,0 +1,20 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

checkpoint-1200/adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-1200/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:58b0b40537121e6640166b361636e3d6e631b7ef0fa83a37e1a7f9eab67a94f6
+size 399137

checkpoint-1200/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a1fd36f9437e0b96215a775dc47a932460b43808f5eca8e08995b26c9c963e58
+size 800441

checkpoint-1200/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1784c9e20ffdc46b706882695c2108245d7626a328b6d70a37d079ad1fbbc989
+size 14575

checkpoint-1200/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d6dd98e7cfba210fc65c065e454c54d2036e5d839020e37f887e58b9a1078c28
+size 627

checkpoint-1200/trainer_state.json ADDED Viewed

	@@ -0,0 +1,160 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.875,
+  "global_step": 1200,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    },
+    {
+      "epoch": 1.8,
+      "learning_rate": 0.0001,
+      "loss": 5.2537,
+      "step": 1150
+    },
+    {
+      "epoch": 1.88,
+      "learning_rate": 0.0001,
+      "loss": 5.2417,
+      "step": 1200
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1768152832376832.0,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1200/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d5f26e97f1b0119d5c7b424eb78527d3e827728609abbb61280f6b4a8e9dc581
+size 3899

checkpoint-1230/README.md ADDED Viewed

	@@ -0,0 +1,20 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

checkpoint-1230/adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-1230/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:10e76dbaec80c330cbd1d5c539c14a2efd75119b6bb7103168aeb03d14dfe2a7
+size 399137

checkpoint-1230/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7c2738002a15d9ded5a097db304db7794321d203cc1d264ebc211e2d3ef9c9b9
+size 800441

checkpoint-1230/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1784c9e20ffdc46b706882695c2108245d7626a328b6d70a37d079ad1fbbc989
+size 14575

checkpoint-1230/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b42493eb50d1931817386a6a0f83ebf07686ed5ccab92ca4ff6722bcbe117645
+size 627

checkpoint-1230/trainer_state.json ADDED Viewed

	@@ -0,0 +1,160 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.921875,
+  "global_step": 1230,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    },
+    {
+      "epoch": 1.8,
+      "learning_rate": 0.0001,
+      "loss": 5.2537,
+      "step": 1150
+    },
+    {
+      "epoch": 1.88,
+      "learning_rate": 0.0001,
+      "loss": 5.2417,
+      "step": 1200
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1812383328632832.0,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1230/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d5f26e97f1b0119d5c7b424eb78527d3e827728609abbb61280f6b4a8e9dc581
+size 3899

checkpoint-1260/README.md ADDED Viewed

	@@ -0,0 +1,20 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- load_in_8bit: False
+- load_in_4bit: True
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0.dev0

checkpoint-1260/adapter_config.json ADDED Viewed

	@@ -0,0 +1,21 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "models/TinyStories-33M",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 8,
+  "lora_dropout": 0.0,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 8,
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "v_proj"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-1260/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a487dc0da239751d16277cba92a93fb3f2028c7d08d27a0931900d6886c348b4
+size 399137

checkpoint-1260/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:dd1519dc76fe53fe97cdf6d2db8299f39b13820a42e3d1443324add2b66aa428
+size 800441

checkpoint-1260/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1784c9e20ffdc46b706882695c2108245d7626a328b6d70a37d079ad1fbbc989
+size 14575

checkpoint-1260/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:547e051ad964f463adf073ebbf9fed974490d2a4f6e2855e0550398319cc30b1
+size 627

checkpoint-1260/trainer_state.json ADDED Viewed

	@@ -0,0 +1,166 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.96875,
+  "global_step": 1260,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    },
+    {
+      "epoch": 1.8,
+      "learning_rate": 0.0001,
+      "loss": 5.2537,
+      "step": 1150
+    },
+    {
+      "epoch": 1.88,
+      "learning_rate": 0.0001,
+      "loss": 5.2417,
+      "step": 1200
+    },
+    {
+      "epoch": 1.95,
+      "learning_rate": 0.0001,
+      "loss": 5.1957,
+      "step": 1250
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1859633842028544.0,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1260/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d5f26e97f1b0119d5c7b424eb78527d3e827728609abbb61280f6b4a8e9dc581
+size 3899

lora.zip ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1fbdd529110ebd5ef2054df4af9cbec5db7c8724dac5f41cc820137fee6b8f4d
+size 479

runs/Jul24_13-30-25_1e592cd3bef2/events.out.tfevents.1690205426.1e592cd3bef2.140.0 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:151193b573ea44f25e6889f5aa4acdee8aec38d61cab1051abe4811b11823e8c
+size 4849

runs/Jul24_13-32-17_1e592cd3bef2/events.out.tfevents.1690205538.1e592cd3bef2.185.0 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d18413cdd8455be5e8f531f3012dfa7791858b895381fa1a0f4911db2435aa95
+size 8969

trainer_state.json ADDED Viewed

	@@ -0,0 +1,175 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 2.0,
+  "global_step": 1280,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.08,
+      "learning_rate": 5e-05,
+      "loss": 10.9274,
+      "step": 50
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 0.0001,
+      "loss": 9.7447,
+      "step": 100
+    },
+    {
+      "epoch": 0.23,
+      "learning_rate": 0.0001,
+      "loss": 7.7718,
+      "step": 150
+    },
+    {
+      "epoch": 0.31,
+      "learning_rate": 0.0001,
+      "loss": 6.8433,
+      "step": 200
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 0.0001,
+      "loss": 6.399,
+      "step": 250
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 0.0001,
+      "loss": 6.1445,
+      "step": 300
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 0.0001,
+      "loss": 5.9761,
+      "step": 350
+    },
+    {
+      "epoch": 0.62,
+      "learning_rate": 0.0001,
+      "loss": 5.8578,
+      "step": 400
+    },
+    {
+      "epoch": 0.7,
+      "learning_rate": 0.0001,
+      "loss": 5.7772,
+      "step": 450
+    },
+    {
+      "epoch": 0.78,
+      "learning_rate": 0.0001,
+      "loss": 5.7197,
+      "step": 500
+    },
+    {
+      "epoch": 0.86,
+      "learning_rate": 0.0001,
+      "loss": 5.633,
+      "step": 550
+    },
+    {
+      "epoch": 0.94,
+      "learning_rate": 0.0001,
+      "loss": 5.6076,
+      "step": 600
+    },
+    {
+      "epoch": 1.02,
+      "learning_rate": 0.0001,
+      "loss": 5.5512,
+      "step": 650
+    },
+    {
+      "epoch": 1.09,
+      "learning_rate": 0.0001,
+      "loss": 5.5049,
+      "step": 700
+    },
+    {
+      "epoch": 1.17,
+      "learning_rate": 0.0001,
+      "loss": 5.4586,
+      "step": 750
+    },
+    {
+      "epoch": 1.25,
+      "learning_rate": 0.0001,
+      "loss": 5.4495,
+      "step": 800
+    },
+    {
+      "epoch": 1.33,
+      "learning_rate": 0.0001,
+      "loss": 5.4038,
+      "step": 850
+    },
+    {
+      "epoch": 1.41,
+      "learning_rate": 0.0001,
+      "loss": 5.3907,
+      "step": 900
+    },
+    {
+      "epoch": 1.48,
+      "learning_rate": 0.0001,
+      "loss": 5.3733,
+      "step": 950
+    },
+    {
+      "epoch": 1.56,
+      "learning_rate": 0.0001,
+      "loss": 5.3187,
+      "step": 1000
+    },
+    {
+      "epoch": 1.64,
+      "learning_rate": 0.0001,
+      "loss": 5.2799,
+      "step": 1050
+    },
+    {
+      "epoch": 1.72,
+      "learning_rate": 0.0001,
+      "loss": 5.2512,
+      "step": 1100
+    },
+    {
+      "epoch": 1.8,
+      "learning_rate": 0.0001,
+      "loss": 5.2537,
+      "step": 1150
+    },
+    {
+      "epoch": 1.88,
+      "learning_rate": 0.0001,
+      "loss": 5.2417,
+      "step": 1200
+    },
+    {
+      "epoch": 1.95,
+      "learning_rate": 0.0001,
+      "loss": 5.1957,
+      "step": 1250
+    },
+    {
+      "epoch": 2.0,
+      "step": 1280,
+      "total_flos": 1889639433529344.0,
+      "train_loss": 6.061862027645111,
+      "train_runtime": 2497.1163,
+      "train_samples_per_second": 65.604,
+      "train_steps_per_second": 0.513
+    }
+  ],
+  "max_steps": 1280,
+  "num_train_epochs": 2,
+  "total_flos": 1889639433529344.0,
+  "trial_name": null,
+  "trial_params": null
+}