Text Generation
Transformers
Safetensors
qwen2
llama-factory
full
Generated from Trainer
conversational
text-generation-inference
Instructions to use Albus-Chen/64k_1.5B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Albus-Chen/64k_1.5B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Albus-Chen/64k_1.5B") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("Albus-Chen/64k_1.5B") model = AutoModelForCausalLM.from_pretrained("Albus-Chen/64k_1.5B", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Albus-Chen/64k_1.5B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Albus-Chen/64k_1.5B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Albus-Chen/64k_1.5B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Albus-Chen/64k_1.5B
- SGLang
How to use Albus-Chen/64k_1.5B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Albus-Chen/64k_1.5B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Albus-Chen/64k_1.5B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Albus-Chen/64k_1.5B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Albus-Chen/64k_1.5B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Albus-Chen/64k_1.5B with Docker Model Runner:
docker model run hf.co/Albus-Chen/64k_1.5B
Download trainer_state.json from Albus-Chen/64k_1.5B: direct link, hf CLI and curl.
- Browser
- Download file 49.3 kB
-
https://huggingface.co/Albus-Chen/64k_1.5B/resolve/main/trainer_state.json
- Command line
-
hf download hf://Albus-Chen/64k_1.5B/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/Albus-Chen/64k_1.5B/resolve/main/trainer_state.json
49.3 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 3000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 1.6595773696899414, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 0.8689, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 0.9993448853492737, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.7907, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 0.6807085275650024, | |
| "learning_rate": 1e-05, | |
| "loss": 0.7264, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 0.48878172039985657, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "loss": 0.6612, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 0.4423200190067291, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 0.6629, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 0.4667101502418518, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6387, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 0.46468427777290344, | |
| "learning_rate": 2.3333333333333336e-05, | |
| "loss": 0.638, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 0.5622338652610779, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "loss": 0.6268, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 0.5090572834014893, | |
| "learning_rate": 3e-05, | |
| "loss": 0.6268, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 0.6103790402412415, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 0.6204, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 0.6360691785812378, | |
| "learning_rate": 3.6666666666666666e-05, | |
| "loss": 0.6087, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.6564140319824219, | |
| "learning_rate": 4e-05, | |
| "loss": 0.6117, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 0.5885344743728638, | |
| "learning_rate": 4.3333333333333334e-05, | |
| "loss": 0.6034, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 0.5539721846580505, | |
| "learning_rate": 4.666666666666667e-05, | |
| "loss": 0.6068, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 0.4922417104244232, | |
| "learning_rate": 5e-05, | |
| "loss": 0.608, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.6012398600578308, | |
| "learning_rate": 4.999848114735858e-05, | |
| "loss": 0.5928, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 0.5108012557029724, | |
| "learning_rate": 4.999392477398737e-05, | |
| "loss": 0.5995, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 0.5281434655189514, | |
| "learning_rate": 4.9986331433523156e-05, | |
| "loss": 0.5824, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 0.7186631560325623, | |
| "learning_rate": 4.997570204861915e-05, | |
| "loss": 0.5867, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.4841364324092865, | |
| "learning_rate": 4.996203791083291e-05, | |
| "loss": 0.5866, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 0.5411853194236755, | |
| "learning_rate": 4.994534068046937e-05, | |
| "loss": 0.5944, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 0.4902998208999634, | |
| "learning_rate": 4.992561238637912e-05, | |
| "loss": 0.5863, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 0.4841536581516266, | |
| "learning_rate": 4.9902855425711905e-05, | |
| "loss": 0.5763, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.4989519715309143, | |
| "learning_rate": 4.9877072563625285e-05, | |
| "loss": 0.5884, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 0.4394078850746155, | |
| "learning_rate": 4.984826693294874e-05, | |
| "loss": 0.5895, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 0.4262292981147766, | |
| "learning_rate": 4.981644203380291e-05, | |
| "loss": 0.5758, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 0.530920684337616, | |
| "learning_rate": 4.978160173317438e-05, | |
| "loss": 0.5657, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 0.4573761522769928, | |
| "learning_rate": 4.974375026444575e-05, | |
| "loss": 0.5722, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 0.45514145493507385, | |
| "learning_rate": 4.970289222688129e-05, | |
| "loss": 0.5686, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 0.43139946460723877, | |
| "learning_rate": 4.965903258506806e-05, | |
| "loss": 0.5801, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 0.4548813998699188, | |
| "learning_rate": 4.961217666831268e-05, | |
| "loss": 0.5646, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.4365274906158447, | |
| "learning_rate": 4.956233016999379e-05, | |
| "loss": 0.5681, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 0.4180664122104645, | |
| "learning_rate": 4.9509499146870236e-05, | |
| "loss": 0.5617, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 0.5416036248207092, | |
| "learning_rate": 4.9453690018345144e-05, | |
| "loss": 0.5715, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 0.5843973159790039, | |
| "learning_rate": 4.9394909565685894e-05, | |
| "loss": 0.5773, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 0.47572824358940125, | |
| "learning_rate": 4.933316493120015e-05, | |
| "loss": 0.5673, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 0.37816718220710754, | |
| "learning_rate": 4.9268463617368e-05, | |
| "loss": 0.5689, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 0.43680626153945923, | |
| "learning_rate": 4.9200813485930375e-05, | |
| "loss": 0.5653, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 0.42846572399139404, | |
| "learning_rate": 4.913022275693372e-05, | |
| "loss": 0.5541, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.4237727224826813, | |
| "learning_rate": 4.905670000773126e-05, | |
| "loss": 0.5716, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 0.4714856743812561, | |
| "learning_rate": 4.8980254171940746e-05, | |
| "loss": 0.5579, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 0.4090372622013092, | |
| "learning_rate": 4.8900894538358944e-05, | |
| "loss": 0.5483, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 0.37138280272483826, | |
| "learning_rate": 4.881863074983298e-05, | |
| "loss": 0.5609, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 0.40046426653862, | |
| "learning_rate": 4.8733472802088654e-05, | |
| "loss": 0.5587, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 0.44308245182037354, | |
| "learning_rate": 4.864543104251587e-05, | |
| "loss": 0.5625, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 0.4166336953639984, | |
| "learning_rate": 4.855451616891136e-05, | |
| "loss": 0.5514, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 0.43248483538627625, | |
| "learning_rate": 4.8460739228178806e-05, | |
| "loss": 0.5496, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.4092395007610321, | |
| "learning_rate": 4.8364111614986527e-05, | |
| "loss": 0.5711, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 0.4332312345504761, | |
| "learning_rate": 4.8264645070382964e-05, | |
| "loss": 0.5539, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 0.3754676580429077, | |
| "learning_rate": 4.8162351680370044e-05, | |
| "loss": 0.5632, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 0.4241037964820862, | |
| "learning_rate": 4.805724387443462e-05, | |
| "loss": 0.559, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 0.4121766686439514, | |
| "learning_rate": 4.7949334424038176e-05, | |
| "loss": 0.5447, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 0.4240052402019501, | |
| "learning_rate": 4.783863644106502e-05, | |
| "loss": 0.5472, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 0.40223944187164307, | |
| "learning_rate": 4.7725163376229064e-05, | |
| "loss": 0.543, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 0.3641127049922943, | |
| "learning_rate": 4.760892901743944e-05, | |
| "loss": 0.5473, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 0.35558176040649414, | |
| "learning_rate": 4.7489947488125175e-05, | |
| "loss": 0.56, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 0.3903762698173523, | |
| "learning_rate": 4.736823324551909e-05, | |
| "loss": 0.5438, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 0.44032081961631775, | |
| "learning_rate": 4.7243801078901084e-05, | |
| "loss": 0.5386, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 0.4052445590496063, | |
| "learning_rate": 4.711666610780115e-05, | |
| "loss": 0.5477, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.4153045415878296, | |
| "learning_rate": 4.698684378016222e-05, | |
| "loss": 0.5389, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 0.4308865964412689, | |
| "learning_rate": 4.685434987046314e-05, | |
| "loss": 0.5476, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 0.346862256526947, | |
| "learning_rate": 4.671920047780186e-05, | |
| "loss": 0.5376, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 0.3750888407230377, | |
| "learning_rate": 4.6581412023939354e-05, | |
| "loss": 0.5345, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.45309221744537354, | |
| "learning_rate": 4.644100125130418e-05, | |
| "loss": 0.5522, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 0.3813372552394867, | |
| "learning_rate": 4.629798522095818e-05, | |
| "loss": 0.5508, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 0.38959550857543945, | |
| "learning_rate": 4.6152381310523387e-05, | |
| "loss": 0.5338, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 0.42343777418136597, | |
| "learning_rate": 4.600420721207053e-05, | |
| "loss": 0.5505, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 0.3677447438240051, | |
| "learning_rate": 4.585348092996925e-05, | |
| "loss": 0.5373, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 0.3684931993484497, | |
| "learning_rate": 4.5700220778700504e-05, | |
| "loss": 0.534, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 0.38051334023475647, | |
| "learning_rate": 4.554444538063113e-05, | |
| "loss": 0.5217, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 0.34087464213371277, | |
| "learning_rate": 4.538617366375112e-05, | |
| "loss": 0.5308, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.33237457275390625, | |
| "learning_rate": 4.522542485937369e-05, | |
| "loss": 0.5276, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 0.3885173499584198, | |
| "learning_rate": 4.5062218499798526e-05, | |
| "loss": 0.5284, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 0.3453039228916168, | |
| "learning_rate": 4.4896574415938465e-05, | |
| "loss": 0.5285, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 0.3653467297554016, | |
| "learning_rate": 4.4728512734909844e-05, | |
| "loss": 0.5313, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 0.3787703216075897, | |
| "learning_rate": 4.455805387758691e-05, | |
| "loss": 0.5446, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 0.39782479405403137, | |
| "learning_rate": 4.438521855612054e-05, | |
| "loss": 0.5436, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 0.38179811835289, | |
| "learning_rate": 4.421002777142148e-05, | |
| "loss": 0.5437, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 0.3457494378089905, | |
| "learning_rate": 4.4032502810608614e-05, | |
| "loss": 0.5311, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.3753390610218048, | |
| "learning_rate": 4.385266524442241e-05, | |
| "loss": 0.5312, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 0.3381490707397461, | |
| "learning_rate": 4.367053692460385e-05, | |
| "loss": 0.5162, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 0.3567236363887787, | |
| "learning_rate": 4.3486139981239304e-05, | |
| "loss": 0.5386, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 0.34833648800849915, | |
| "learning_rate": 4.3299496820071546e-05, | |
| "loss": 0.5275, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 0.3650229871273041, | |
| "learning_rate": 4.311063011977723e-05, | |
| "loss": 0.5296, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 0.385339617729187, | |
| "learning_rate": 4.2919562829211283e-05, | |
| "loss": 0.5284, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 0.3674757778644562, | |
| "learning_rate": 4.2726318164618435e-05, | |
| "loss": 0.5346, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 0.3463813364505768, | |
| "learning_rate": 4.2530919606812216e-05, | |
| "loss": 0.5343, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.3939419388771057, | |
| "learning_rate": 4.233339089832189e-05, | |
| "loss": 0.5289, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 0.3567444086074829, | |
| "learning_rate": 4.21337560405075e-05, | |
| "loss": 0.5313, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 0.3429320752620697, | |
| "learning_rate": 4.193203929064353e-05, | |
| "loss": 0.5143, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 0.3867582082748413, | |
| "learning_rate": 4.172826515897146e-05, | |
| "loss": 0.528, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 0.3279944360256195, | |
| "learning_rate": 4.152245840572153e-05, | |
| "loss": 0.5239, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 0.35522711277008057, | |
| "learning_rate": 4.131464403810422e-05, | |
| "loss": 0.5395, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 0.32539644837379456, | |
| "learning_rate": 4.110484730727161e-05, | |
| "loss": 0.5289, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 0.36315691471099854, | |
| "learning_rate": 4.089309370524921e-05, | |
| "loss": 0.5134, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.38284584879875183, | |
| "learning_rate": 4.067940896183843e-05, | |
| "loss": 0.5174, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 0.3352174162864685, | |
| "learning_rate": 4.046381904149024e-05, | |
| "loss": 0.5234, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 0.35670560598373413, | |
| "learning_rate": 4.024635014015023e-05, | |
| "loss": 0.5159, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 0.4193209111690521, | |
| "learning_rate": 4.002702868207563e-05, | |
| "loss": 0.5254, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.33531010150909424, | |
| "learning_rate": 3.9805881316624506e-05, | |
| "loss": 0.5075, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 0.34601059556007385, | |
| "learning_rate": 3.9582934915017665e-05, | |
| "loss": 0.4798, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 0.3596339523792267, | |
| "learning_rate": 3.935821656707359e-05, | |
| "loss": 0.4755, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 0.3714556097984314, | |
| "learning_rate": 3.91317535779168e-05, | |
| "loss": 0.4793, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 0.4134692847728729, | |
| "learning_rate": 3.890357346466001e-05, | |
| "loss": 0.4663, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 0.34835919737815857, | |
| "learning_rate": 3.867370395306068e-05, | |
| "loss": 0.476, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 0.34882938861846924, | |
| "learning_rate": 3.844217297415196e-05, | |
| "loss": 0.4683, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 0.42797595262527466, | |
| "learning_rate": 3.8209008660848974e-05, | |
| "loss": 0.4645, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 0.32183897495269775, | |
| "learning_rate": 3.797423934453038e-05, | |
| "loss": 0.4766, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 0.3546960651874542, | |
| "learning_rate": 3.773789355159587e-05, | |
| "loss": 0.4797, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 0.36568915843963623, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 0.4765, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 0.3618831932544708, | |
| "learning_rate": 3.726058759576271e-05, | |
| "loss": 0.4688, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 0.3192635178565979, | |
| "learning_rate": 3.7019685429456986e-05, | |
| "loss": 0.4686, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 0.3199959993362427, | |
| "learning_rate": 3.6777322772674186e-05, | |
| "loss": 0.4766, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 1.1400000000000001, | |
| "grad_norm": 0.34484583139419556, | |
| "learning_rate": 3.65335290744672e-05, | |
| "loss": 0.4779, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 0.32886865735054016, | |
| "learning_rate": 3.628833395777224e-05, | |
| "loss": 0.4758, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 0.350413978099823, | |
| "learning_rate": 3.604176721580935e-05, | |
| "loss": 0.4755, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 0.3193204700946808, | |
| "learning_rate": 3.579385880846232e-05, | |
| "loss": 0.4616, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 0.3464047610759735, | |
| "learning_rate": 3.5544638858638304e-05, | |
| "loss": 0.478, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 0.37507447600364685, | |
| "learning_rate": 3.5294137648607625e-05, | |
| "loss": 0.4776, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.33693036437034607, | |
| "learning_rate": 3.504238561632424e-05, | |
| "loss": 0.4636, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 0.32532545924186707, | |
| "learning_rate": 3.478941335172729e-05, | |
| "loss": 0.47, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 0.36955147981643677, | |
| "learning_rate": 3.453525159302415e-05, | |
| "loss": 0.4854, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 0.3343319296836853, | |
| "learning_rate": 3.427993122295552e-05, | |
| "loss": 0.4865, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 0.3173106908798218, | |
| "learning_rate": 3.4023483265042874e-05, | |
| "loss": 0.4691, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 0.3691994845867157, | |
| "learning_rate": 3.376593887981887e-05, | |
| "loss": 0.4821, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 0.4036237597465515, | |
| "learning_rate": 3.350732936104108e-05, | |
| "loss": 0.4702, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 0.32201361656188965, | |
| "learning_rate": 3.3247686131889574e-05, | |
| "loss": 0.4678, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 0.33225005865097046, | |
| "learning_rate": 3.29870407411487e-05, | |
| "loss": 0.478, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 0.3761782944202423, | |
| "learning_rate": 3.272542485937369e-05, | |
| "loss": 0.4708, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 0.34827953577041626, | |
| "learning_rate": 3.246287027504237e-05, | |
| "loss": 0.4662, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 0.34097573161125183, | |
| "learning_rate": 3.2199408890692655e-05, | |
| "loss": 0.4713, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 0.361167311668396, | |
| "learning_rate": 3.1935072719046115e-05, | |
| "loss": 0.4712, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 0.3238449990749359, | |
| "learning_rate": 3.1669893879118156e-05, | |
| "loss": 0.4698, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 0.33388492465019226, | |
| "learning_rate": 3.140390459231528e-05, | |
| "loss": 0.4682, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 0.3103346526622772, | |
| "learning_rate": 3.1137137178519985e-05, | |
| "loss": 0.4789, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 1.3599999999999999, | |
| "grad_norm": 0.3352946639060974, | |
| "learning_rate": 3.086962405216353e-05, | |
| "loss": 0.4731, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 0.31056320667266846, | |
| "learning_rate": 3.06013977182874e-05, | |
| "loss": 0.4668, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 0.5738754868507385, | |
| "learning_rate": 3.0332490768593675e-05, | |
| "loss": 0.4633, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 1.3900000000000001, | |
| "grad_norm": 0.3080455958843231, | |
| "learning_rate": 3.0062935877484804e-05, | |
| "loss": 0.4842, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.3119259476661682, | |
| "learning_rate": 2.9792765798093465e-05, | |
| "loss": 0.4832, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 0.34111911058425903, | |
| "learning_rate": 2.952201335830275e-05, | |
| "loss": 0.4726, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 0.35389259457588196, | |
| "learning_rate": 2.925071145675733e-05, | |
| "loss": 0.4744, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 0.3371218740940094, | |
| "learning_rate": 2.8978893058865987e-05, | |
| "loss": 0.4618, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 0.306376188993454, | |
| "learning_rate": 2.870659119279605e-05, | |
| "loss": 0.4965, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 0.33145007491111755, | |
| "learning_rate": 2.8433838945460205e-05, | |
| "loss": 0.4778, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 0.3250512480735779, | |
| "learning_rate": 2.8160669458496158e-05, | |
| "loss": 0.4759, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 0.3200785219669342, | |
| "learning_rate": 2.788711592423966e-05, | |
| "loss": 0.4714, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 0.3664354979991913, | |
| "learning_rate": 2.761321158169134e-05, | |
| "loss": 0.4634, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 0.33875763416290283, | |
| "learning_rate": 2.7338989712477945e-05, | |
| "loss": 0.473, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 0.3120327293872833, | |
| "learning_rate": 2.7064483636808313e-05, | |
| "loss": 0.4601, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 0.3270907700061798, | |
| "learning_rate": 2.678972670942468e-05, | |
| "loss": 0.469, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 0.3123275339603424, | |
| "learning_rate": 2.6514752315549847e-05, | |
| "loss": 0.4643, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 0.29727503657341003, | |
| "learning_rate": 2.623959386683056e-05, | |
| "loss": 0.4668, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 0.3350415527820587, | |
| "learning_rate": 2.5964284797277762e-05, | |
| "loss": 0.4786, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 0.31216147541999817, | |
| "learning_rate": 2.5688858559204053e-05, | |
| "loss": 0.4716, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 0.33024659752845764, | |
| "learning_rate": 2.5413348619158967e-05, | |
| "loss": 0.4758, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 1.5699999999999998, | |
| "grad_norm": 0.32393544912338257, | |
| "learning_rate": 2.5137788453862515e-05, | |
| "loss": 0.4742, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 0.3421013057231903, | |
| "learning_rate": 2.486221154613749e-05, | |
| "loss": 0.4572, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 1.5899999999999999, | |
| "grad_norm": 0.32907870411872864, | |
| "learning_rate": 2.458665138084104e-05, | |
| "loss": 0.4676, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.31299474835395813, | |
| "learning_rate": 2.4311141440795953e-05, | |
| "loss": 0.4626, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.6099999999999999, | |
| "grad_norm": 0.3338111340999603, | |
| "learning_rate": 2.4035715202722237e-05, | |
| "loss": 0.4606, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 0.34725725650787354, | |
| "learning_rate": 2.3760406133169443e-05, | |
| "loss": 0.4647, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 0.3239111602306366, | |
| "learning_rate": 2.3485247684450166e-05, | |
| "loss": 0.4605, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.3050364851951599, | |
| "learning_rate": 2.3210273290575333e-05, | |
| "loss": 0.4608, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 0.3005702793598175, | |
| "learning_rate": 2.2935516363191693e-05, | |
| "loss": 0.4635, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 1.6600000000000001, | |
| "grad_norm": 0.30899298191070557, | |
| "learning_rate": 2.2661010287522057e-05, | |
| "loss": 0.4674, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 0.3082168698310852, | |
| "learning_rate": 2.238678841830867e-05, | |
| "loss": 0.4658, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 1.6800000000000002, | |
| "grad_norm": 0.2973801791667938, | |
| "learning_rate": 2.2112884075760347e-05, | |
| "loss": 0.4678, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 0.30037522315979004, | |
| "learning_rate": 2.1839330541503845e-05, | |
| "loss": 0.4607, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 0.3158698081970215, | |
| "learning_rate": 2.1566161054539798e-05, | |
| "loss": 0.4631, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 0.31011322140693665, | |
| "learning_rate": 2.1293408807203947e-05, | |
| "loss": 0.4633, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 0.31316834688186646, | |
| "learning_rate": 2.1021106941134012e-05, | |
| "loss": 0.4679, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 0.31946825981140137, | |
| "learning_rate": 2.074928854324268e-05, | |
| "loss": 0.4702, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 0.2985219955444336, | |
| "learning_rate": 2.047798664169726e-05, | |
| "loss": 0.4664, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 0.30881017446517944, | |
| "learning_rate": 2.0207234201906547e-05, | |
| "loss": 0.4601, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 0.3028377890586853, | |
| "learning_rate": 1.9937064122515202e-05, | |
| "loss": 0.4737, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 0.3166395127773285, | |
| "learning_rate": 1.9667509231406334e-05, | |
| "loss": 0.4567, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 0.32097935676574707, | |
| "learning_rate": 1.9398602281712604e-05, | |
| "loss": 0.4627, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 0.2962646186351776, | |
| "learning_rate": 1.913037594783648e-05, | |
| "loss": 0.4578, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.3011949062347412, | |
| "learning_rate": 1.8862862821480025e-05, | |
| "loss": 0.4548, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 0.31912025809288025, | |
| "learning_rate": 1.859609540768471e-05, | |
| "loss": 0.455, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 1.8199999999999998, | |
| "grad_norm": 0.35504528880119324, | |
| "learning_rate": 1.8330106120881846e-05, | |
| "loss": 0.4662, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 0.3003298342227936, | |
| "learning_rate": 1.806492728095389e-05, | |
| "loss": 0.4652, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 1.8399999999999999, | |
| "grad_norm": 0.28152137994766235, | |
| "learning_rate": 1.780059110930735e-05, | |
| "loss": 0.4632, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 0.3089231252670288, | |
| "learning_rate": 1.7537129724957642e-05, | |
| "loss": 0.456, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.8599999999999999, | |
| "grad_norm": 0.28241249918937683, | |
| "learning_rate": 1.7274575140626318e-05, | |
| "loss": 0.4583, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 0.3157854676246643, | |
| "learning_rate": 1.70129592588513e-05, | |
| "loss": 0.4564, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 0.29856443405151367, | |
| "learning_rate": 1.675231386811043e-05, | |
| "loss": 0.4685, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 1.8900000000000001, | |
| "grad_norm": 0.3080819249153137, | |
| "learning_rate": 1.6492670638958924e-05, | |
| "loss": 0.4696, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 0.29385536909103394, | |
| "learning_rate": 1.6234061120181142e-05, | |
| "loss": 0.4633, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.9100000000000001, | |
| "grad_norm": 0.30132725834846497, | |
| "learning_rate": 1.5976516734957138e-05, | |
| "loss": 0.455, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 0.30257880687713623, | |
| "learning_rate": 1.5720068777044476e-05, | |
| "loss": 0.4551, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 1.9300000000000002, | |
| "grad_norm": 0.30634188652038574, | |
| "learning_rate": 1.5464748406975847e-05, | |
| "loss": 0.4614, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 0.3279210329055786, | |
| "learning_rate": 1.521058664827272e-05, | |
| "loss": 0.4588, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 0.28984227776527405, | |
| "learning_rate": 1.495761438367577e-05, | |
| "loss": 0.4478, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 0.2909398078918457, | |
| "learning_rate": 1.4705862351392379e-05, | |
| "loss": 0.4659, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 0.3059076964855194, | |
| "learning_rate": 1.44553611413617e-05, | |
| "loss": 0.4586, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 0.2801637351512909, | |
| "learning_rate": 1.4206141191537682e-05, | |
| "loss": 0.4589, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 0.2810831367969513, | |
| "learning_rate": 1.395823278419065e-05, | |
| "loss": 0.4532, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.33695289492607117, | |
| "learning_rate": 1.3711666042227772e-05, | |
| "loss": 0.4526, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 2.01, | |
| "grad_norm": 0.33088284730911255, | |
| "learning_rate": 1.346647092553281e-05, | |
| "loss": 0.4157, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 2.02, | |
| "grad_norm": 0.3108139932155609, | |
| "learning_rate": 1.322267722732582e-05, | |
| "loss": 0.4165, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 2.03, | |
| "grad_norm": 0.3126479685306549, | |
| "learning_rate": 1.2980314570543006e-05, | |
| "loss": 0.4217, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 2.04, | |
| "grad_norm": 0.30750831961631775, | |
| "learning_rate": 1.2739412404237306e-05, | |
| "loss": 0.4132, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 2.05, | |
| "grad_norm": 0.30336615443229675, | |
| "learning_rate": 1.2500000000000006e-05, | |
| "loss": 0.4076, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 2.06, | |
| "grad_norm": 0.27100318670272827, | |
| "learning_rate": 1.2262106448404132e-05, | |
| "loss": 0.407, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 2.07, | |
| "grad_norm": 0.2856077253818512, | |
| "learning_rate": 1.202576065546963e-05, | |
| "loss": 0.4133, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 2.08, | |
| "grad_norm": 0.28364866971969604, | |
| "learning_rate": 1.1790991339151031e-05, | |
| "loss": 0.4149, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 2.09, | |
| "grad_norm": 0.3136128783226013, | |
| "learning_rate": 1.1557827025848047e-05, | |
| "loss": 0.4128, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 2.1, | |
| "grad_norm": 0.33352553844451904, | |
| "learning_rate": 1.1326296046939333e-05, | |
| "loss": 0.4119, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 2.11, | |
| "grad_norm": 0.27613121271133423, | |
| "learning_rate": 1.1096426535339985e-05, | |
| "loss": 0.412, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 2.12, | |
| "grad_norm": 0.3114316463470459, | |
| "learning_rate": 1.0868246422083204e-05, | |
| "loss": 0.4144, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 2.13, | |
| "grad_norm": 0.31617745757102966, | |
| "learning_rate": 1.064178343292641e-05, | |
| "loss": 0.4043, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 2.14, | |
| "grad_norm": 0.3409804105758667, | |
| "learning_rate": 1.0417065084982346e-05, | |
| "loss": 0.4147, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 2.15, | |
| "grad_norm": 0.331616073846817, | |
| "learning_rate": 1.0194118683375503e-05, | |
| "loss": 0.406, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 2.16, | |
| "grad_norm": 0.3145408630371094, | |
| "learning_rate": 9.972971317924374e-06, | |
| "loss": 0.3991, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 2.17, | |
| "grad_norm": 0.33192431926727295, | |
| "learning_rate": 9.753649859849775e-06, | |
| "loss": 0.4106, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 2.18, | |
| "grad_norm": 0.3115055561065674, | |
| "learning_rate": 9.536180958509768e-06, | |
| "loss": 0.4096, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 2.19, | |
| "grad_norm": 0.30449178814888, | |
| "learning_rate": 9.320591038161574e-06, | |
| "loss": 0.4091, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 0.2961597740650177, | |
| "learning_rate": 9.106906294750805e-06, | |
| "loss": 0.3989, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 2.21, | |
| "grad_norm": 0.3159533441066742, | |
| "learning_rate": 8.895152692728397e-06, | |
| "loss": 0.408, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 2.22, | |
| "grad_norm": 0.3212539553642273, | |
| "learning_rate": 8.685355961895784e-06, | |
| "loss": 0.4135, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 2.23, | |
| "grad_norm": 0.30796176195144653, | |
| "learning_rate": 8.477541594278474e-06, | |
| "loss": 0.4119, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 2.24, | |
| "grad_norm": 0.3158734440803528, | |
| "learning_rate": 8.271734841028553e-06, | |
| "loss": 0.4064, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 2.25, | |
| "grad_norm": 0.3129909038543701, | |
| "learning_rate": 8.067960709356478e-06, | |
| "loss": 0.42, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 2.26, | |
| "grad_norm": 0.2892637848854065, | |
| "learning_rate": 7.866243959492509e-06, | |
| "loss": 0.4095, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 2.27, | |
| "grad_norm": 0.2881993353366852, | |
| "learning_rate": 7.666609101678121e-06, | |
| "loss": 0.406, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 2.2800000000000002, | |
| "grad_norm": 0.2821005582809448, | |
| "learning_rate": 7.469080393187786e-06, | |
| "loss": 0.4105, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 2.29, | |
| "grad_norm": 0.289115846157074, | |
| "learning_rate": 7.273681835381569e-06, | |
| "loss": 0.4135, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 2.3, | |
| "grad_norm": 0.30809682607650757, | |
| "learning_rate": 7.080437170788723e-06, | |
| "loss": 0.4088, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 2.31, | |
| "grad_norm": 0.3143822252750397, | |
| "learning_rate": 6.889369880222776e-06, | |
| "loss": 0.4073, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 2.32, | |
| "grad_norm": 0.3024907410144806, | |
| "learning_rate": 6.700503179928458e-06, | |
| "loss": 0.4081, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 2.33, | |
| "grad_norm": 0.310665488243103, | |
| "learning_rate": 6.513860018760698e-06, | |
| "loss": 0.4142, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 2.34, | |
| "grad_norm": 0.3210834264755249, | |
| "learning_rate": 6.329463075396161e-06, | |
| "loss": 0.4156, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 2.35, | |
| "grad_norm": 0.30473592877388, | |
| "learning_rate": 6.147334755577596e-06, | |
| "loss": 0.4178, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 2.36, | |
| "grad_norm": 0.2942945063114166, | |
| "learning_rate": 5.967497189391386e-06, | |
| "loss": 0.4016, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 2.37, | |
| "grad_norm": 0.2914084792137146, | |
| "learning_rate": 5.78997222857853e-06, | |
| "loss": 0.4098, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 2.38, | |
| "grad_norm": 0.30221128463745117, | |
| "learning_rate": 5.614781443879463e-06, | |
| "loss": 0.4058, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 2.39, | |
| "grad_norm": 0.31281960010528564, | |
| "learning_rate": 5.441946122413086e-06, | |
| "loss": 0.4057, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 2.4, | |
| "grad_norm": 0.2758500874042511, | |
| "learning_rate": 5.271487265090163e-06, | |
| "loss": 0.4118, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 2.41, | |
| "grad_norm": 0.296254426240921, | |
| "learning_rate": 5.103425584061538e-06, | |
| "loss": 0.401, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 2.42, | |
| "grad_norm": 0.2951298654079437, | |
| "learning_rate": 4.937781500201474e-06, | |
| "loss": 0.4003, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 2.43, | |
| "grad_norm": 0.3158932030200958, | |
| "learning_rate": 4.7745751406263165e-06, | |
| "loss": 0.4169, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 2.44, | |
| "grad_norm": 0.30102699995040894, | |
| "learning_rate": 4.613826336248881e-06, | |
| "loss": 0.4118, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 2.45, | |
| "grad_norm": 0.2914685904979706, | |
| "learning_rate": 4.4555546193688735e-06, | |
| "loss": 0.409, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 2.46, | |
| "grad_norm": 0.3147742748260498, | |
| "learning_rate": 4.299779221299499e-06, | |
| "loss": 0.4116, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 2.4699999999999998, | |
| "grad_norm": 0.29551076889038086, | |
| "learning_rate": 4.146519070030757e-06, | |
| "loss": 0.4032, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 2.48, | |
| "grad_norm": 0.2961500883102417, | |
| "learning_rate": 3.995792787929481e-06, | |
| "loss": 0.4049, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 2.49, | |
| "grad_norm": 0.29260537028312683, | |
| "learning_rate": 3.847618689476612e-06, | |
| "loss": 0.4047, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 0.2954242527484894, | |
| "learning_rate": 3.7020147790418263e-06, | |
| "loss": 0.4023, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.51, | |
| "grad_norm": 0.3183572590351105, | |
| "learning_rate": 3.5589987486958243e-06, | |
| "loss": 0.4125, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 2.52, | |
| "grad_norm": 0.30055201053619385, | |
| "learning_rate": 3.418587976060653e-06, | |
| "loss": 0.4166, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 2.5300000000000002, | |
| "grad_norm": 0.29363346099853516, | |
| "learning_rate": 3.280799522198144e-06, | |
| "loss": 0.4143, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 2.54, | |
| "grad_norm": 0.2946094870567322, | |
| "learning_rate": 3.145650129536862e-06, | |
| "loss": 0.4063, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 2.55, | |
| "grad_norm": 0.3245265483856201, | |
| "learning_rate": 3.013156219837776e-06, | |
| "loss": 0.4066, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 2.56, | |
| "grad_norm": 0.2841097414493561, | |
| "learning_rate": 2.883333892198853e-06, | |
| "loss": 0.4035, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 2.57, | |
| "grad_norm": 0.27192243933677673, | |
| "learning_rate": 2.7561989210989235e-06, | |
| "loss": 0.4052, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 2.58, | |
| "grad_norm": 0.2928083837032318, | |
| "learning_rate": 2.6317667544809134e-06, | |
| "loss": 0.4016, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 2.59, | |
| "grad_norm": 0.2984160780906677, | |
| "learning_rate": 2.510052511874822e-06, | |
| "loss": 0.3986, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 2.6, | |
| "grad_norm": 0.2815227806568146, | |
| "learning_rate": 2.391070982560564e-06, | |
| "loss": 0.402, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 2.61, | |
| "grad_norm": 0.262170672416687, | |
| "learning_rate": 2.2748366237709374e-06, | |
| "loss": 0.4043, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 2.62, | |
| "grad_norm": 0.2785099148750305, | |
| "learning_rate": 2.1613635589349756e-06, | |
| "loss": 0.4114, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 2.63, | |
| "grad_norm": 0.293804407119751, | |
| "learning_rate": 2.0506655759618244e-06, | |
| "loss": 0.4166, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 2.64, | |
| "grad_norm": 0.2911376357078552, | |
| "learning_rate": 1.9427561255653816e-06, | |
| "loss": 0.4082, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 2.65, | |
| "grad_norm": 0.30202075839042664, | |
| "learning_rate": 1.837648319629956e-06, | |
| "loss": 0.4043, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 2.66, | |
| "grad_norm": 0.317266047000885, | |
| "learning_rate": 1.735354929617042e-06, | |
| "loss": 0.415, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 2.67, | |
| "grad_norm": 0.2760041058063507, | |
| "learning_rate": 1.6358883850134816e-06, | |
| "loss": 0.4119, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 2.68, | |
| "grad_norm": 0.2752744257450104, | |
| "learning_rate": 1.5392607718211994e-06, | |
| "loss": 0.4044, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 2.69, | |
| "grad_norm": 0.2895498275756836, | |
| "learning_rate": 1.4454838310886425e-06, | |
| "loss": 0.4076, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 2.7, | |
| "grad_norm": 0.2708493769168854, | |
| "learning_rate": 1.3545689574841342e-06, | |
| "loss": 0.4023, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 2.71, | |
| "grad_norm": 0.2823054790496826, | |
| "learning_rate": 1.266527197911352e-06, | |
| "loss": 0.403, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 2.7199999999999998, | |
| "grad_norm": 0.2689080834388733, | |
| "learning_rate": 1.1813692501670276e-06, | |
| "loss": 0.407, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 2.73, | |
| "grad_norm": 0.2879767417907715, | |
| "learning_rate": 1.0991054616410589e-06, | |
| "loss": 0.4087, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 2.74, | |
| "grad_norm": 0.28133150935173035, | |
| "learning_rate": 1.0197458280592542e-06, | |
| "loss": 0.413, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 2.75, | |
| "grad_norm": 0.31199556589126587, | |
| "learning_rate": 9.432999922687396e-07, | |
| "loss": 0.4006, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 2.76, | |
| "grad_norm": 0.2973596751689911, | |
| "learning_rate": 8.697772430662859e-07, | |
| "loss": 0.3971, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 2.77, | |
| "grad_norm": 0.28426092863082886, | |
| "learning_rate": 7.991865140696331e-07, | |
| "loss": 0.3985, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 2.7800000000000002, | |
| "grad_norm": 0.3040194511413574, | |
| "learning_rate": 7.315363826320005e-07, | |
| "loss": 0.4136, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 2.79, | |
| "grad_norm": 0.29921281337738037, | |
| "learning_rate": 6.668350687998565e-07, | |
| "loss": 0.3974, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 0.2804381847381592, | |
| "learning_rate": 6.050904343141095e-07, | |
| "loss": 0.4149, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 2.81, | |
| "grad_norm": 0.25890785455703735, | |
| "learning_rate": 5.463099816548579e-07, | |
| "loss": 0.4081, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 2.82, | |
| "grad_norm": 0.29002565145492554, | |
| "learning_rate": 4.905008531297661e-07, | |
| "loss": 0.4105, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 2.83, | |
| "grad_norm": 0.27962175011634827, | |
| "learning_rate": 4.3766983000621266e-07, | |
| "loss": 0.404, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 2.84, | |
| "grad_norm": 0.3119331896305084, | |
| "learning_rate": 3.8782333168732033e-07, | |
| "loss": 0.4053, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 2.85, | |
| "grad_norm": 0.29932940006256104, | |
| "learning_rate": 3.4096741493194197e-07, | |
| "loss": 0.4109, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 2.86, | |
| "grad_norm": 0.28117814660072327, | |
| "learning_rate": 2.9710777311871e-07, | |
| "loss": 0.4116, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 2.87, | |
| "grad_norm": 0.2876632511615753, | |
| "learning_rate": 2.5624973555424815e-07, | |
| "loss": 0.4029, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 2.88, | |
| "grad_norm": 0.28768378496170044, | |
| "learning_rate": 2.1839826682562015e-07, | |
| "loss": 0.41, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 2.89, | |
| "grad_norm": 0.29716014862060547, | |
| "learning_rate": 1.8355796619708987e-07, | |
| "loss": 0.4096, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 2.9, | |
| "grad_norm": 0.3086964786052704, | |
| "learning_rate": 1.517330670512629e-07, | |
| "loss": 0.4061, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 2.91, | |
| "grad_norm": 0.29135850071907043, | |
| "learning_rate": 1.229274363747146e-07, | |
| "loss": 0.4074, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 2.92, | |
| "grad_norm": 0.2806086242198944, | |
| "learning_rate": 9.71445742881022e-08, | |
| "loss": 0.4172, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 2.93, | |
| "grad_norm": 0.28173452615737915, | |
| "learning_rate": 7.438761362087987e-08, | |
| "loss": 0.4036, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 2.94, | |
| "grad_norm": 0.2816000282764435, | |
| "learning_rate": 5.4659319530636633e-08, | |
| "loss": 0.4054, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 2.95, | |
| "grad_norm": 0.28980112075805664, | |
| "learning_rate": 3.796208916709565e-08, | |
| "loss": 0.4147, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 2.96, | |
| "grad_norm": 0.2769039273262024, | |
| "learning_rate": 2.429795138085278e-08, | |
| "loss": 0.3919, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 2.9699999999999998, | |
| "grad_norm": 0.2771114110946655, | |
| "learning_rate": 1.3668566476848777e-08, | |
| "loss": 0.4115, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 2.98, | |
| "grad_norm": 0.30404967069625854, | |
| "learning_rate": 6.075226012636215e-09, | |
| "loss": 0.4037, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 2.99, | |
| "grad_norm": 0.26605767011642456, | |
| "learning_rate": 1.5188526414244842e-09, | |
| "loss": 0.418, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.2867048978805542, | |
| "learning_rate": 0.0, | |
| "loss": 0.4038, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 3000, | |
| "total_flos": 1.5946996047134327e+19, | |
| "train_loss": 0.4809082725048065, | |
| "train_runtime": 188478.9372, | |
| "train_samples_per_second": 1.019, | |
| "train_steps_per_second": 0.016 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 3000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": false, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.5946996047134327e+19, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |