Matir commited on
Commit
9249355
·
1 Parent(s): 55fc4e0

Quantize to FP8

Browse files
Dockerfile CHANGED
@@ -11,6 +11,9 @@ WORKDIR /app
11
  # Copy requirements and install
12
  COPY requirements.txt .
13
  RUN pip install --no-cache-dir -r requirements.txt
 
 
 
14
 
15
  # Copy application code
16
  COPY main.py .
 
11
  # Copy requirements and install
12
  COPY requirements.txt .
13
  RUN pip install --no-cache-dir -r requirements.txt
14
+ # Install Flash Attention 2 using pre-built wheels (requires torch to be installed first)
15
+ RUN pip install packaging
16
+ RUN pip install flash-attn --no-build-isolation --no-cache-dir
17
 
18
  # Copy application code
19
  COPY main.py .
config.json CHANGED
@@ -40,6 +40,25 @@
40
  "audio_token_id": 151648,
41
  "dtype": "bfloat16",
42
  "model_type": "vibevoice_asr",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
43
  "semantic_tokenizer_encoder_config": {
44
  "channels": 1,
45
  "depths": [
@@ -130,5 +149,5 @@
130
  "use_sliding_window": false,
131
  "vocab_size": 152064
132
  },
133
- "transformers_version": "5.3.0.dev0"
134
  }
 
40
  "audio_token_id": 151648,
41
  "dtype": "bfloat16",
42
  "model_type": "vibevoice_asr",
43
+ "quantization_config": {
44
+ "include_input_output_embeddings": false,
45
+ "modules_to_not_convert": null,
46
+ "quant_method": "torchao",
47
+ "quant_type": {
48
+ "default": {
49
+ "_data": {
50
+ "set_inductor_config": true,
51
+ "weight_dtype": {
52
+ "_data": "float8_e4m3fn",
53
+ "_type": "torch.dtype"
54
+ }
55
+ },
56
+ "_type": "Float8WeightOnlyConfig",
57
+ "_version": 2
58
+ }
59
+ },
60
+ "untie_embedding_weights": false
61
+ },
62
  "semantic_tokenizer_encoder_config": {
63
  "channels": 1,
64
  "depths": [
 
149
  "use_sliding_window": false,
150
  "vocab_size": 152064
151
  },
152
+ "transformers_version": "5.9.0"
153
  }
generation_config.json CHANGED
@@ -7,6 +7,6 @@
7
  "output_attentions": false,
8
  "output_hidden_states": false,
9
  "pad_token_id": 151655,
10
- "transformers_version": "5.3.0.dev0",
11
  "use_cache": true
12
  }
 
7
  "output_attentions": false,
8
  "output_hidden_states": false,
9
  "pad_token_id": 151655,
10
+ "transformers_version": "5.9.0",
11
  "use_cache": true
12
  }
main.py CHANGED
@@ -7,6 +7,7 @@ import logging
7
  import os
8
  import sys
9
  import tempfile
 
10
  import traceback
11
 
12
  from fastapi import FastAPI, Request, Response, HTTPException
@@ -14,6 +15,15 @@ from fastapi.responses import JSONResponse
14
 
15
  from typing import Dict, Any
16
 
 
 
 
 
 
 
 
 
 
17
  # this must come before attempts to import from transformers or torch
18
  print(f'Versions: transformers: {version("transformers")}, torch: {version("torch")}')
19
 
@@ -24,10 +34,6 @@ import librosa
24
  from transformers.models.auto.processing_auto import AutoProcessor
25
  from transformers.models.vibevoice_asr.modeling_vibevoice_asr import VibeVoiceAsrForConditionalGeneration
26
 
27
- # Configure logging
28
- logging.basicConfig(level=logging.INFO)
29
- logger = logging.getLogger(__name__)
30
-
31
  class EndpointHandler():
32
  def __init__(self, path=""):
33
  # 1. Load the processor
@@ -37,13 +43,27 @@ class EndpointHandler():
37
  self.model = VibeVoiceAsrForConditionalGeneration.from_pretrained(
38
  path,
39
  torch_dtype=torch.bfloat16,
40
- device_map="auto"
 
41
  )
42
 
 
 
 
 
 
 
 
 
 
 
 
 
43
  # 3. Dynamically fetch the expected sample rate (usually 16kHz or 24kHz)
44
  self.target_sr = getattr(self.processor.feature_extractor, "sampling_rate", 16000)
45
 
46
  def __call__(self, data: Any) -> Dict[str, Any]:
 
47
  # 1. Extract payload (Handles both JSON payloads and raw binary uploads)
48
  if isinstance(data, dict):
49
  data_copy = data.copy()
@@ -65,8 +85,11 @@ class EndpointHandler():
65
  audio_array = None
66
 
67
  # 2. Decode raw audio bytes (various formats) using librosa
 
 
68
  try:
69
  if isinstance(inputs, bytes):
 
70
  # Raw bytes from binary upload (could be MP3, WAV, FLAC, etc.)
71
  # Write to suffix-less temp file so librosa auto-detects format
72
  temp_file = tempfile.NamedTemporaryFile("wb", delete=False)
@@ -78,6 +101,7 @@ class EndpointHandler():
78
 
79
  elif isinstance(inputs, str):
80
  if inputs.startswith("http://") or inputs.startswith("https://"):
 
81
  # URL input - download first to be safe with librosa
82
  import requests
83
  response = requests.get(inputs)
@@ -88,6 +112,7 @@ class EndpointHandler():
88
 
89
  audio_array, _ = librosa.load(temp_file.name, sr=self.target_sr, mono=True)
90
  else:
 
91
  # Try base64 decode
92
  try:
93
  decoded_bytes = base64.b64decode(inputs)
@@ -97,13 +122,23 @@ class EndpointHandler():
97
  temp_file.close()
98
 
99
  audio_array, _ = librosa.load(temp_file.name, sr=self.target_sr, mono=True)
100
- except Exception:
 
101
  # Fallback to assuming it's a local path
102
  audio_array, _ = librosa.load(inputs, sr=self.target_sr, mono=True)
103
  else:
 
104
  # If already loaded (e.g. numpy array passed in some test environments)
105
  audio_array = inputs
106
 
 
 
 
 
 
 
 
 
107
  processed_inputs = self.processor.apply_transcription_request(
108
  audio=audio_array,
109
  prompt=hotwords
@@ -117,14 +152,19 @@ class EndpointHandler():
117
  processed_inputs[k] = v.to(device=self.model.device, dtype=self.model.dtype)
118
  else:
119
  processed_inputs[k] = v.to(device=self.model.device)
 
120
 
121
  # 4. Generate
 
 
122
  with torch.no_grad():
123
  output_ids = self.model.generate(
124
  **processed_inputs,
125
  # CRITICAL: VibeVoice needs a massive token limit to handle long-form audio.
126
  max_new_tokens=32768
127
  )
 
 
128
 
129
  # Slice generated IDs to exclude the prompt (Fixes prompt leakage)
130
  if "input_ids" in processed_inputs:
@@ -134,12 +174,18 @@ class EndpointHandler():
134
  generated_ids = output_ids
135
 
136
  # 5. Decode using return_format
 
 
137
  try:
138
  transcription = self.processor.decode(generated_ids, return_format=return_format)[0]
139
  except Exception as e:
 
140
  # Fallback to standard decode if return_format fails
141
  transcription = self.processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
 
142
 
 
 
143
  return {"result": transcription}
144
 
145
  except Exception as e:
 
7
  import os
8
  import sys
9
  import tempfile
10
+ import time
11
  import traceback
12
 
13
  from fastapi import FastAPI, Request, Response, HTTPException
 
15
 
16
  from typing import Dict, Any
17
 
18
+ # Configure logging with timestamps as a fallback
19
+ logging.basicConfig(
20
+ level=logging.INFO,
21
+ format="%(asctime)s [%(levelname)s] %(name)s: %(message)s",
22
+ datefmt="%Y-%m-%d %H:%M:%S"
23
+ )
24
+ # Use uvicorn's error logger if running under uvicorn, which handles formatting nicely
25
+ logger = logging.getLogger("uvicorn.error")
26
+
27
  # this must come before attempts to import from transformers or torch
28
  print(f'Versions: transformers: {version("transformers")}, torch: {version("torch")}')
29
 
 
34
  from transformers.models.auto.processing_auto import AutoProcessor
35
  from transformers.models.vibevoice_asr.modeling_vibevoice_asr import VibeVoiceAsrForConditionalGeneration
36
 
 
 
 
 
37
  class EndpointHandler():
38
  def __init__(self, path=""):
39
  # 1. Load the processor
 
43
  self.model = VibeVoiceAsrForConditionalGeneration.from_pretrained(
44
  path,
45
  torch_dtype=torch.bfloat16,
46
+ device_map="auto",
47
+ attn_implementation="flash_attention_2"
48
  )
49
 
50
+ # Print layer device allocation
51
+ if hasattr(self.model, "hf_device_map"):
52
+ logger.info("Model layers device allocation (hf_device_map):")
53
+ for layer_name, device in self.model.hf_device_map.items():
54
+ logger.info(f" - {layer_name}: {device}")
55
+ else:
56
+ # Fallback if hf_device_map is not populated
57
+ devices = set()
58
+ for name, param in self.model.named_parameters():
59
+ devices.add(str(param.device))
60
+ logger.info(f"Model loaded. Active devices for parameters: {list(devices)}")
61
+
62
  # 3. Dynamically fetch the expected sample rate (usually 16kHz or 24kHz)
63
  self.target_sr = getattr(self.processor.feature_extractor, "sampling_rate", 16000)
64
 
65
  def __call__(self, data: Any) -> Dict[str, Any]:
66
+ start_time = time.time()
67
  # 1. Extract payload (Handles both JSON payloads and raw binary uploads)
68
  if isinstance(data, dict):
69
  data_copy = data.copy()
 
85
  audio_array = None
86
 
87
  # 2. Decode raw audio bytes (various formats) using librosa
88
+ logger.info("Starting audio loading and preprocessing...")
89
+ audio_load_start = time.time()
90
  try:
91
  if isinstance(inputs, bytes):
92
+ logger.info(f"Decoding audio from raw bytes ({len(inputs)} bytes)...")
93
  # Raw bytes from binary upload (could be MP3, WAV, FLAC, etc.)
94
  # Write to suffix-less temp file so librosa auto-detects format
95
  temp_file = tempfile.NamedTemporaryFile("wb", delete=False)
 
101
 
102
  elif isinstance(inputs, str):
103
  if inputs.startswith("http://") or inputs.startswith("https://"):
104
+ logger.info(f"Downloading audio from URL: {inputs}...")
105
  # URL input - download first to be safe with librosa
106
  import requests
107
  response = requests.get(inputs)
 
112
 
113
  audio_array, _ = librosa.load(temp_file.name, sr=self.target_sr, mono=True)
114
  else:
115
+ logger.info("Decoding audio from Base64 string...")
116
  # Try base64 decode
117
  try:
118
  decoded_bytes = base64.b64decode(inputs)
 
122
  temp_file.close()
123
 
124
  audio_array, _ = librosa.load(temp_file.name, sr=self.target_sr, mono=True)
125
+ except Exception as e:
126
+ logger.info(f"Base64 decode failed ({e}), assuming input is a local file path...")
127
  # Fallback to assuming it's a local path
128
  audio_array, _ = librosa.load(inputs, sr=self.target_sr, mono=True)
129
  else:
130
+ logger.info("Using pre-loaded audio array...")
131
  # If already loaded (e.g. numpy array passed in some test environments)
132
  audio_array = inputs
133
 
134
+ audio_load_duration = time.time() - audio_load_start
135
+ audio_duration_sec = len(audio_array) / self.target_sr if audio_array is not None else 0
136
+ logger.info(f"Audio loaded successfully in {audio_load_duration:.3f}s. "
137
+ f"Audio duration: {audio_duration_sec:.2f}s, Sample Rate: {self.target_sr}Hz")
138
+
139
+ # 3. Prepare inputs using the recommended API
140
+ logger.info("Preprocessing audio features...")
141
+ preprocess_start = time.time()
142
  processed_inputs = self.processor.apply_transcription_request(
143
  audio=audio_array,
144
  prompt=hotwords
 
152
  processed_inputs[k] = v.to(device=self.model.device, dtype=self.model.dtype)
153
  else:
154
  processed_inputs[k] = v.to(device=self.model.device)
155
+ logger.info(f"Preprocessing completed in {time.time() - preprocess_start:.3f}s.")
156
 
157
  # 4. Generate
158
+ logger.info("Starting model inference (generation)...")
159
+ inference_start = time.time()
160
  with torch.no_grad():
161
  output_ids = self.model.generate(
162
  **processed_inputs,
163
  # CRITICAL: VibeVoice needs a massive token limit to handle long-form audio.
164
  max_new_tokens=32768
165
  )
166
+ inference_duration = time.time() - inference_start
167
+ logger.info(f"Model inference completed in {inference_duration:.3f}s.")
168
 
169
  # Slice generated IDs to exclude the prompt (Fixes prompt leakage)
170
  if "input_ids" in processed_inputs:
 
174
  generated_ids = output_ids
175
 
176
  # 5. Decode using return_format
177
+ logger.info(f"Decoding generated tokens to text (format: '{return_format}')...")
178
+ decode_start = time.time()
179
  try:
180
  transcription = self.processor.decode(generated_ids, return_format=return_format)[0]
181
  except Exception as e:
182
+ logger.warning(f"Decoding with return_format='{return_format}' failed, falling back to batch_decode. Error: {e}")
183
  # Fallback to standard decode if return_format fails
184
  transcription = self.processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
185
+ logger.info(f"Token decoding completed in {time.time() - decode_start:.3f}s.")
186
 
187
+ total_duration = time.time() - start_time
188
+ logger.info(f"Request processed successfully in {total_duration:.3f}s.")
189
  return {"result": transcription}
190
 
191
  except Exception as e:
model-00002-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:65e419d28fc8c87d6938ec611c7b425b38e391c80a2df59c2b4935f6fd65c7c2
3
- size 2389316008
 
 
 
 
model-00003-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:30f574c764550d26c654cc3f5dd000b90b0c3305db955267c577001c1013fdf7
3
- size 2466376400
 
 
 
 
model-00004-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:8fa3d9350f0a8cc97524617ff582e451159bfdba2ef0b2e372a627518ef681b1
3
- size 2466376432
 
 
 
 
model-00005-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:5015ecacc86d897d20d5e42ba52ef83355d42f587d3b158ff897ec94847bd083
3
- size 2499431160
 
 
 
 
model-00006-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:7463d75607185c118925cea6a60a5698aaa6f428e626bcee774572bdc28ef55d
3
- size 1831435704
 
 
 
 
model-00007-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:b52aa2fab9640bcac5201a278f540b018c439ed4e99516d9ff30ea1ae399525e
3
- size 2482226384
 
 
 
 
model-00008-of-00008.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:a66ced85b619507e1970dc51be45786ff55803ccc63658765e412ea23d9a8ace
3
- size 37262376
 
 
 
 
model-00001-of-00008.safetensors → model.safetensors RENAMED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:580189757a1c737ecc6fad16e633b922bc73220268356e31362c24365f081095
3
- size 2488346304
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b5e993e59216ef2ba3213a5cec6d76594f0ed9205d168352c037f31b5b6e45e9
3
+ size 9511924456
model.safetensors.index.json DELETED
@@ -1,909 +0,0 @@
1
- {
2
- "metadata": {
3
- "total_parameters": 8330325888,
4
- "total_size": 16660651776
5
- },
6
- "weight_map": {
7
- "acoustic_tokenizer_encoder.conv_layers.0.conv.conv.bias": "model-00007-of-00008.safetensors",
8
- "acoustic_tokenizer_encoder.conv_layers.0.conv.conv.weight": "model-00007-of-00008.safetensors",
9
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
10
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
11
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
12
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
13
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
14
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
15
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.gamma": "model-00007-of-00008.safetensors",
16
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
17
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
18
- "acoustic_tokenizer_encoder.conv_layers.0.stage.0.norm.weight": "model-00007-of-00008.safetensors",
19
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
20
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
21
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
22
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
23
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
24
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
25
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.gamma": "model-00007-of-00008.safetensors",
26
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
27
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
28
- "acoustic_tokenizer_encoder.conv_layers.0.stage.1.norm.weight": "model-00007-of-00008.safetensors",
29
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
30
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
31
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
32
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
33
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
34
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
35
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.gamma": "model-00007-of-00008.safetensors",
36
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
37
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
38
- "acoustic_tokenizer_encoder.conv_layers.0.stage.2.norm.weight": "model-00007-of-00008.safetensors",
39
- "acoustic_tokenizer_encoder.conv_layers.1.conv.conv.bias": "model-00007-of-00008.safetensors",
40
- "acoustic_tokenizer_encoder.conv_layers.1.conv.conv.weight": "model-00007-of-00008.safetensors",
41
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
42
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
43
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
44
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
45
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
46
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
47
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.gamma": "model-00007-of-00008.safetensors",
48
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
49
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
50
- "acoustic_tokenizer_encoder.conv_layers.1.stage.0.norm.weight": "model-00007-of-00008.safetensors",
51
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
52
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
53
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
54
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
55
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
56
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
57
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.gamma": "model-00007-of-00008.safetensors",
58
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
59
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
60
- "acoustic_tokenizer_encoder.conv_layers.1.stage.1.norm.weight": "model-00007-of-00008.safetensors",
61
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
62
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
63
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
64
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
65
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
66
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
67
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.gamma": "model-00007-of-00008.safetensors",
68
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
69
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
70
- "acoustic_tokenizer_encoder.conv_layers.1.stage.2.norm.weight": "model-00007-of-00008.safetensors",
71
- "acoustic_tokenizer_encoder.conv_layers.2.conv.conv.bias": "model-00007-of-00008.safetensors",
72
- "acoustic_tokenizer_encoder.conv_layers.2.conv.conv.weight": "model-00007-of-00008.safetensors",
73
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
74
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
75
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
76
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
77
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
78
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
79
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.gamma": "model-00007-of-00008.safetensors",
80
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
81
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
82
- "acoustic_tokenizer_encoder.conv_layers.2.stage.0.norm.weight": "model-00007-of-00008.safetensors",
83
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
84
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
85
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
86
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
87
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
88
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
89
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.gamma": "model-00007-of-00008.safetensors",
90
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
91
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
92
- "acoustic_tokenizer_encoder.conv_layers.2.stage.1.norm.weight": "model-00007-of-00008.safetensors",
93
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
94
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
95
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
96
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
97
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
98
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
99
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.gamma": "model-00007-of-00008.safetensors",
100
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
101
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
102
- "acoustic_tokenizer_encoder.conv_layers.2.stage.2.norm.weight": "model-00007-of-00008.safetensors",
103
- "acoustic_tokenizer_encoder.conv_layers.3.conv.conv.bias": "model-00007-of-00008.safetensors",
104
- "acoustic_tokenizer_encoder.conv_layers.3.conv.conv.weight": "model-00007-of-00008.safetensors",
105
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
106
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
107
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
108
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
109
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
110
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
111
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.gamma": "model-00007-of-00008.safetensors",
112
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
113
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
114
- "acoustic_tokenizer_encoder.conv_layers.3.stage.0.norm.weight": "model-00007-of-00008.safetensors",
115
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
116
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
117
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
118
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
119
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
120
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
121
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.gamma": "model-00007-of-00008.safetensors",
122
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
123
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
124
- "acoustic_tokenizer_encoder.conv_layers.3.stage.1.norm.weight": "model-00007-of-00008.safetensors",
125
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
126
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
127
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
128
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
129
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
130
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
131
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.gamma": "model-00007-of-00008.safetensors",
132
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
133
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
134
- "acoustic_tokenizer_encoder.conv_layers.3.stage.2.norm.weight": "model-00007-of-00008.safetensors",
135
- "acoustic_tokenizer_encoder.conv_layers.4.conv.conv.bias": "model-00007-of-00008.safetensors",
136
- "acoustic_tokenizer_encoder.conv_layers.4.conv.conv.weight": "model-00007-of-00008.safetensors",
137
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
138
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
139
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
140
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
141
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
142
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
143
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.gamma": "model-00007-of-00008.safetensors",
144
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
145
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
146
- "acoustic_tokenizer_encoder.conv_layers.4.stage.0.norm.weight": "model-00007-of-00008.safetensors",
147
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
148
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
149
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
150
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
151
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
152
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
153
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.gamma": "model-00007-of-00008.safetensors",
154
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
155
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
156
- "acoustic_tokenizer_encoder.conv_layers.4.stage.1.norm.weight": "model-00007-of-00008.safetensors",
157
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
158
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
159
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
160
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
161
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
162
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
163
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.gamma": "model-00007-of-00008.safetensors",
164
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
165
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
166
- "acoustic_tokenizer_encoder.conv_layers.4.stage.2.norm.weight": "model-00007-of-00008.safetensors",
167
- "acoustic_tokenizer_encoder.conv_layers.5.conv.conv.bias": "model-00007-of-00008.safetensors",
168
- "acoustic_tokenizer_encoder.conv_layers.5.conv.conv.weight": "model-00007-of-00008.safetensors",
169
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
170
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
171
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
172
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
173
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
174
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
175
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.gamma": "model-00007-of-00008.safetensors",
176
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
177
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
178
- "acoustic_tokenizer_encoder.conv_layers.5.stage.0.norm.weight": "model-00007-of-00008.safetensors",
179
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
180
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
181
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
182
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
183
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
184
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
185
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.gamma": "model-00007-of-00008.safetensors",
186
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
187
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
188
- "acoustic_tokenizer_encoder.conv_layers.5.stage.1.norm.weight": "model-00007-of-00008.safetensors",
189
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
190
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
191
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
192
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
193
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
194
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
195
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.gamma": "model-00007-of-00008.safetensors",
196
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
197
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
198
- "acoustic_tokenizer_encoder.conv_layers.5.stage.2.norm.weight": "model-00007-of-00008.safetensors",
199
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear1.bias": "model-00007-of-00008.safetensors",
200
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear1.weight": "model-00007-of-00008.safetensors",
201
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear2.bias": "model-00007-of-00008.safetensors",
202
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear2.weight": "model-00007-of-00008.safetensors",
203
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn_gamma": "model-00007-of-00008.safetensors",
204
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.ffn_norm.weight": "model-00007-of-00008.safetensors",
205
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.gamma": "model-00007-of-00008.safetensors",
206
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.mixer.conv.bias": "model-00007-of-00008.safetensors",
207
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.mixer.conv.weight": "model-00007-of-00008.safetensors",
208
- "acoustic_tokenizer_encoder.conv_layers.5.stage.3.norm.weight": "model-00007-of-00008.safetensors",
209
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear1.bias": "model-00007-of-00008.safetensors",
210
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear1.weight": "model-00007-of-00008.safetensors",
211
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear2.bias": "model-00007-of-00008.safetensors",
212
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear2.weight": "model-00007-of-00008.safetensors",
213
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn_gamma": "model-00007-of-00008.safetensors",
214
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.ffn_norm.weight": "model-00007-of-00008.safetensors",
215
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.gamma": "model-00007-of-00008.safetensors",
216
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.mixer.conv.bias": "model-00007-of-00008.safetensors",
217
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.mixer.conv.weight": "model-00007-of-00008.safetensors",
218
- "acoustic_tokenizer_encoder.conv_layers.5.stage.4.norm.weight": "model-00007-of-00008.safetensors",
219
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear1.bias": "model-00007-of-00008.safetensors",
220
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear1.weight": "model-00007-of-00008.safetensors",
221
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear2.bias": "model-00007-of-00008.safetensors",
222
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear2.weight": "model-00007-of-00008.safetensors",
223
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn_gamma": "model-00007-of-00008.safetensors",
224
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.ffn_norm.weight": "model-00007-of-00008.safetensors",
225
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.gamma": "model-00007-of-00008.safetensors",
226
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.mixer.conv.bias": "model-00007-of-00008.safetensors",
227
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.mixer.conv.weight": "model-00007-of-00008.safetensors",
228
- "acoustic_tokenizer_encoder.conv_layers.5.stage.5.norm.weight": "model-00007-of-00008.safetensors",
229
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear1.bias": "model-00007-of-00008.safetensors",
230
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear1.weight": "model-00007-of-00008.safetensors",
231
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear2.bias": "model-00007-of-00008.safetensors",
232
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear2.weight": "model-00007-of-00008.safetensors",
233
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn_gamma": "model-00007-of-00008.safetensors",
234
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.ffn_norm.weight": "model-00007-of-00008.safetensors",
235
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.gamma": "model-00007-of-00008.safetensors",
236
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.mixer.conv.bias": "model-00007-of-00008.safetensors",
237
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.mixer.conv.weight": "model-00007-of-00008.safetensors",
238
- "acoustic_tokenizer_encoder.conv_layers.5.stage.6.norm.weight": "model-00007-of-00008.safetensors",
239
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear1.bias": "model-00007-of-00008.safetensors",
240
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear1.weight": "model-00007-of-00008.safetensors",
241
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear2.bias": "model-00007-of-00008.safetensors",
242
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear2.weight": "model-00007-of-00008.safetensors",
243
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn_gamma": "model-00007-of-00008.safetensors",
244
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.ffn_norm.weight": "model-00007-of-00008.safetensors",
245
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.gamma": "model-00007-of-00008.safetensors",
246
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.mixer.conv.bias": "model-00007-of-00008.safetensors",
247
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.mixer.conv.weight": "model-00007-of-00008.safetensors",
248
- "acoustic_tokenizer_encoder.conv_layers.5.stage.7.norm.weight": "model-00007-of-00008.safetensors",
249
- "acoustic_tokenizer_encoder.head.conv.bias": "model-00007-of-00008.safetensors",
250
- "acoustic_tokenizer_encoder.head.conv.weight": "model-00007-of-00008.safetensors",
251
- "acoustic_tokenizer_encoder.stem.conv.conv.bias": "model-00007-of-00008.safetensors",
252
- "acoustic_tokenizer_encoder.stem.conv.conv.weight": "model-00007-of-00008.safetensors",
253
- "acoustic_tokenizer_encoder.stem.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
254
- "acoustic_tokenizer_encoder.stem.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
255
- "acoustic_tokenizer_encoder.stem.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
256
- "acoustic_tokenizer_encoder.stem.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
257
- "acoustic_tokenizer_encoder.stem.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
258
- "acoustic_tokenizer_encoder.stem.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
259
- "acoustic_tokenizer_encoder.stem.stage.0.gamma": "model-00007-of-00008.safetensors",
260
- "acoustic_tokenizer_encoder.stem.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
261
- "acoustic_tokenizer_encoder.stem.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
262
- "acoustic_tokenizer_encoder.stem.stage.0.norm.weight": "model-00007-of-00008.safetensors",
263
- "acoustic_tokenizer_encoder.stem.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
264
- "acoustic_tokenizer_encoder.stem.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
265
- "acoustic_tokenizer_encoder.stem.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
266
- "acoustic_tokenizer_encoder.stem.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
267
- "acoustic_tokenizer_encoder.stem.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
268
- "acoustic_tokenizer_encoder.stem.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
269
- "acoustic_tokenizer_encoder.stem.stage.1.gamma": "model-00007-of-00008.safetensors",
270
- "acoustic_tokenizer_encoder.stem.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
271
- "acoustic_tokenizer_encoder.stem.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
272
- "acoustic_tokenizer_encoder.stem.stage.1.norm.weight": "model-00007-of-00008.safetensors",
273
- "acoustic_tokenizer_encoder.stem.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
274
- "acoustic_tokenizer_encoder.stem.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
275
- "acoustic_tokenizer_encoder.stem.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
276
- "acoustic_tokenizer_encoder.stem.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
277
- "acoustic_tokenizer_encoder.stem.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
278
- "acoustic_tokenizer_encoder.stem.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
279
- "acoustic_tokenizer_encoder.stem.stage.2.gamma": "model-00007-of-00008.safetensors",
280
- "acoustic_tokenizer_encoder.stem.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
281
- "acoustic_tokenizer_encoder.stem.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
282
- "acoustic_tokenizer_encoder.stem.stage.2.norm.weight": "model-00007-of-00008.safetensors",
283
- "language_model.lm_head.weight": "model-00007-of-00008.safetensors",
284
- "language_model.model.embed_tokens.weight": "model-00001-of-00008.safetensors",
285
- "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00008.safetensors",
286
- "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
287
- "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
288
- "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
289
- "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
290
- "language_model.model.layers.0.self_attn.k_proj.bias": "model-00001-of-00008.safetensors",
291
- "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
292
- "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
293
- "language_model.model.layers.0.self_attn.q_proj.bias": "model-00001-of-00008.safetensors",
294
- "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
295
- "language_model.model.layers.0.self_attn.v_proj.bias": "model-00001-of-00008.safetensors",
296
- "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
297
- "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00008.safetensors",
298
- "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
299
- "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
300
- "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
301
- "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
302
- "language_model.model.layers.1.self_attn.k_proj.bias": "model-00001-of-00008.safetensors",
303
- "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
304
- "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
305
- "language_model.model.layers.1.self_attn.q_proj.bias": "model-00001-of-00008.safetensors",
306
- "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
307
- "language_model.model.layers.1.self_attn.v_proj.bias": "model-00001-of-00008.safetensors",
308
- "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
309
- "language_model.model.layers.10.input_layernorm.weight": "model-00003-of-00008.safetensors",
310
- "language_model.model.layers.10.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
311
- "language_model.model.layers.10.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
312
- "language_model.model.layers.10.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
313
- "language_model.model.layers.10.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
314
- "language_model.model.layers.10.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
315
- "language_model.model.layers.10.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
316
- "language_model.model.layers.10.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
317
- "language_model.model.layers.10.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
318
- "language_model.model.layers.10.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
319
- "language_model.model.layers.10.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
320
- "language_model.model.layers.10.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
321
- "language_model.model.layers.11.input_layernorm.weight": "model-00003-of-00008.safetensors",
322
- "language_model.model.layers.11.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
323
- "language_model.model.layers.11.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
324
- "language_model.model.layers.11.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
325
- "language_model.model.layers.11.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
326
- "language_model.model.layers.11.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
327
- "language_model.model.layers.11.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
328
- "language_model.model.layers.11.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
329
- "language_model.model.layers.11.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
330
- "language_model.model.layers.11.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
331
- "language_model.model.layers.11.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
332
- "language_model.model.layers.11.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
333
- "language_model.model.layers.12.input_layernorm.weight": "model-00003-of-00008.safetensors",
334
- "language_model.model.layers.12.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
335
- "language_model.model.layers.12.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
336
- "language_model.model.layers.12.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
337
- "language_model.model.layers.12.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
338
- "language_model.model.layers.12.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
339
- "language_model.model.layers.12.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
340
- "language_model.model.layers.12.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
341
- "language_model.model.layers.12.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
342
- "language_model.model.layers.12.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
343
- "language_model.model.layers.12.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
344
- "language_model.model.layers.12.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
345
- "language_model.model.layers.13.input_layernorm.weight": "model-00004-of-00008.safetensors",
346
- "language_model.model.layers.13.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
347
- "language_model.model.layers.13.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
348
- "language_model.model.layers.13.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
349
- "language_model.model.layers.13.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
350
- "language_model.model.layers.13.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
351
- "language_model.model.layers.13.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
352
- "language_model.model.layers.13.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
353
- "language_model.model.layers.13.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
354
- "language_model.model.layers.13.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
355
- "language_model.model.layers.13.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
356
- "language_model.model.layers.13.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
357
- "language_model.model.layers.14.input_layernorm.weight": "model-00004-of-00008.safetensors",
358
- "language_model.model.layers.14.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
359
- "language_model.model.layers.14.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
360
- "language_model.model.layers.14.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
361
- "language_model.model.layers.14.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
362
- "language_model.model.layers.14.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
363
- "language_model.model.layers.14.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
364
- "language_model.model.layers.14.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
365
- "language_model.model.layers.14.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
366
- "language_model.model.layers.14.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
367
- "language_model.model.layers.14.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
368
- "language_model.model.layers.14.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
369
- "language_model.model.layers.15.input_layernorm.weight": "model-00004-of-00008.safetensors",
370
- "language_model.model.layers.15.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
371
- "language_model.model.layers.15.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
372
- "language_model.model.layers.15.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
373
- "language_model.model.layers.15.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
374
- "language_model.model.layers.15.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
375
- "language_model.model.layers.15.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
376
- "language_model.model.layers.15.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
377
- "language_model.model.layers.15.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
378
- "language_model.model.layers.15.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
379
- "language_model.model.layers.15.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
380
- "language_model.model.layers.15.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
381
- "language_model.model.layers.16.input_layernorm.weight": "model-00004-of-00008.safetensors",
382
- "language_model.model.layers.16.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
383
- "language_model.model.layers.16.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
384
- "language_model.model.layers.16.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
385
- "language_model.model.layers.16.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
386
- "language_model.model.layers.16.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
387
- "language_model.model.layers.16.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
388
- "language_model.model.layers.16.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
389
- "language_model.model.layers.16.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
390
- "language_model.model.layers.16.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
391
- "language_model.model.layers.16.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
392
- "language_model.model.layers.16.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
393
- "language_model.model.layers.17.input_layernorm.weight": "model-00004-of-00008.safetensors",
394
- "language_model.model.layers.17.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
395
- "language_model.model.layers.17.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
396
- "language_model.model.layers.17.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
397
- "language_model.model.layers.17.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
398
- "language_model.model.layers.17.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
399
- "language_model.model.layers.17.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
400
- "language_model.model.layers.17.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
401
- "language_model.model.layers.17.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
402
- "language_model.model.layers.17.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
403
- "language_model.model.layers.17.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
404
- "language_model.model.layers.17.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
405
- "language_model.model.layers.18.input_layernorm.weight": "model-00005-of-00008.safetensors",
406
- "language_model.model.layers.18.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
407
- "language_model.model.layers.18.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
408
- "language_model.model.layers.18.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
409
- "language_model.model.layers.18.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
410
- "language_model.model.layers.18.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
411
- "language_model.model.layers.18.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
412
- "language_model.model.layers.18.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
413
- "language_model.model.layers.18.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
414
- "language_model.model.layers.18.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
415
- "language_model.model.layers.18.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
416
- "language_model.model.layers.18.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
417
- "language_model.model.layers.19.input_layernorm.weight": "model-00005-of-00008.safetensors",
418
- "language_model.model.layers.19.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
419
- "language_model.model.layers.19.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
420
- "language_model.model.layers.19.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
421
- "language_model.model.layers.19.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
422
- "language_model.model.layers.19.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
423
- "language_model.model.layers.19.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
424
- "language_model.model.layers.19.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
425
- "language_model.model.layers.19.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
426
- "language_model.model.layers.19.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
427
- "language_model.model.layers.19.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
428
- "language_model.model.layers.19.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
429
- "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00008.safetensors",
430
- "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
431
- "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
432
- "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
433
- "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
434
- "language_model.model.layers.2.self_attn.k_proj.bias": "model-00001-of-00008.safetensors",
435
- "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
436
- "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
437
- "language_model.model.layers.2.self_attn.q_proj.bias": "model-00001-of-00008.safetensors",
438
- "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
439
- "language_model.model.layers.2.self_attn.v_proj.bias": "model-00001-of-00008.safetensors",
440
- "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
441
- "language_model.model.layers.20.input_layernorm.weight": "model-00005-of-00008.safetensors",
442
- "language_model.model.layers.20.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
443
- "language_model.model.layers.20.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
444
- "language_model.model.layers.20.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
445
- "language_model.model.layers.20.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
446
- "language_model.model.layers.20.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
447
- "language_model.model.layers.20.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
448
- "language_model.model.layers.20.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
449
- "language_model.model.layers.20.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
450
- "language_model.model.layers.20.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
451
- "language_model.model.layers.20.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
452
- "language_model.model.layers.20.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
453
- "language_model.model.layers.21.input_layernorm.weight": "model-00005-of-00008.safetensors",
454
- "language_model.model.layers.21.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
455
- "language_model.model.layers.21.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
456
- "language_model.model.layers.21.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
457
- "language_model.model.layers.21.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
458
- "language_model.model.layers.21.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
459
- "language_model.model.layers.21.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
460
- "language_model.model.layers.21.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
461
- "language_model.model.layers.21.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
462
- "language_model.model.layers.21.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
463
- "language_model.model.layers.21.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
464
- "language_model.model.layers.21.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
465
- "language_model.model.layers.22.input_layernorm.weight": "model-00005-of-00008.safetensors",
466
- "language_model.model.layers.22.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
467
- "language_model.model.layers.22.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
468
- "language_model.model.layers.22.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
469
- "language_model.model.layers.22.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
470
- "language_model.model.layers.22.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
471
- "language_model.model.layers.22.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
472
- "language_model.model.layers.22.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
473
- "language_model.model.layers.22.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
474
- "language_model.model.layers.22.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
475
- "language_model.model.layers.22.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
476
- "language_model.model.layers.22.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
477
- "language_model.model.layers.23.input_layernorm.weight": "model-00005-of-00008.safetensors",
478
- "language_model.model.layers.23.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
479
- "language_model.model.layers.23.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
480
- "language_model.model.layers.23.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
481
- "language_model.model.layers.23.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
482
- "language_model.model.layers.23.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
483
- "language_model.model.layers.23.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
484
- "language_model.model.layers.23.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
485
- "language_model.model.layers.23.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
486
- "language_model.model.layers.23.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
487
- "language_model.model.layers.23.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
488
- "language_model.model.layers.23.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
489
- "language_model.model.layers.24.input_layernorm.weight": "model-00006-of-00008.safetensors",
490
- "language_model.model.layers.24.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
491
- "language_model.model.layers.24.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
492
- "language_model.model.layers.24.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
493
- "language_model.model.layers.24.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
494
- "language_model.model.layers.24.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
495
- "language_model.model.layers.24.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
496
- "language_model.model.layers.24.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
497
- "language_model.model.layers.24.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
498
- "language_model.model.layers.24.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
499
- "language_model.model.layers.24.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
500
- "language_model.model.layers.24.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
501
- "language_model.model.layers.25.input_layernorm.weight": "model-00006-of-00008.safetensors",
502
- "language_model.model.layers.25.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
503
- "language_model.model.layers.25.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
504
- "language_model.model.layers.25.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
505
- "language_model.model.layers.25.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
506
- "language_model.model.layers.25.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
507
- "language_model.model.layers.25.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
508
- "language_model.model.layers.25.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
509
- "language_model.model.layers.25.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
510
- "language_model.model.layers.25.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
511
- "language_model.model.layers.25.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
512
- "language_model.model.layers.25.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
513
- "language_model.model.layers.26.input_layernorm.weight": "model-00006-of-00008.safetensors",
514
- "language_model.model.layers.26.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
515
- "language_model.model.layers.26.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
516
- "language_model.model.layers.26.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
517
- "language_model.model.layers.26.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
518
- "language_model.model.layers.26.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
519
- "language_model.model.layers.26.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
520
- "language_model.model.layers.26.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
521
- "language_model.model.layers.26.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
522
- "language_model.model.layers.26.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
523
- "language_model.model.layers.26.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
524
- "language_model.model.layers.26.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
525
- "language_model.model.layers.27.input_layernorm.weight": "model-00006-of-00008.safetensors",
526
- "language_model.model.layers.27.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
527
- "language_model.model.layers.27.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
528
- "language_model.model.layers.27.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
529
- "language_model.model.layers.27.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
530
- "language_model.model.layers.27.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
531
- "language_model.model.layers.27.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
532
- "language_model.model.layers.27.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
533
- "language_model.model.layers.27.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
534
- "language_model.model.layers.27.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
535
- "language_model.model.layers.27.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
536
- "language_model.model.layers.27.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
537
- "language_model.model.layers.3.input_layernorm.weight": "model-00002-of-00008.safetensors",
538
- "language_model.model.layers.3.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
539
- "language_model.model.layers.3.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
540
- "language_model.model.layers.3.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
541
- "language_model.model.layers.3.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
542
- "language_model.model.layers.3.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
543
- "language_model.model.layers.3.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
544
- "language_model.model.layers.3.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
545
- "language_model.model.layers.3.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
546
- "language_model.model.layers.3.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
547
- "language_model.model.layers.3.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
548
- "language_model.model.layers.3.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
549
- "language_model.model.layers.4.input_layernorm.weight": "model-00002-of-00008.safetensors",
550
- "language_model.model.layers.4.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
551
- "language_model.model.layers.4.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
552
- "language_model.model.layers.4.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
553
- "language_model.model.layers.4.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
554
- "language_model.model.layers.4.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
555
- "language_model.model.layers.4.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
556
- "language_model.model.layers.4.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
557
- "language_model.model.layers.4.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
558
- "language_model.model.layers.4.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
559
- "language_model.model.layers.4.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
560
- "language_model.model.layers.4.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
561
- "language_model.model.layers.5.input_layernorm.weight": "model-00002-of-00008.safetensors",
562
- "language_model.model.layers.5.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
563
- "language_model.model.layers.5.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
564
- "language_model.model.layers.5.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
565
- "language_model.model.layers.5.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
566
- "language_model.model.layers.5.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
567
- "language_model.model.layers.5.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
568
- "language_model.model.layers.5.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
569
- "language_model.model.layers.5.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
570
- "language_model.model.layers.5.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
571
- "language_model.model.layers.5.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
572
- "language_model.model.layers.5.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
573
- "language_model.model.layers.6.input_layernorm.weight": "model-00002-of-00008.safetensors",
574
- "language_model.model.layers.6.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
575
- "language_model.model.layers.6.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
576
- "language_model.model.layers.6.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
577
- "language_model.model.layers.6.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
578
- "language_model.model.layers.6.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
579
- "language_model.model.layers.6.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
580
- "language_model.model.layers.6.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
581
- "language_model.model.layers.6.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
582
- "language_model.model.layers.6.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
583
- "language_model.model.layers.6.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
584
- "language_model.model.layers.6.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
585
- "language_model.model.layers.7.input_layernorm.weight": "model-00002-of-00008.safetensors",
586
- "language_model.model.layers.7.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
587
- "language_model.model.layers.7.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
588
- "language_model.model.layers.7.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
589
- "language_model.model.layers.7.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
590
- "language_model.model.layers.7.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
591
- "language_model.model.layers.7.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
592
- "language_model.model.layers.7.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
593
- "language_model.model.layers.7.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
594
- "language_model.model.layers.7.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
595
- "language_model.model.layers.7.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
596
- "language_model.model.layers.7.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
597
- "language_model.model.layers.8.input_layernorm.weight": "model-00003-of-00008.safetensors",
598
- "language_model.model.layers.8.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
599
- "language_model.model.layers.8.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
600
- "language_model.model.layers.8.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
601
- "language_model.model.layers.8.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
602
- "language_model.model.layers.8.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
603
- "language_model.model.layers.8.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
604
- "language_model.model.layers.8.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
605
- "language_model.model.layers.8.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
606
- "language_model.model.layers.8.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
607
- "language_model.model.layers.8.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
608
- "language_model.model.layers.8.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
609
- "language_model.model.layers.9.input_layernorm.weight": "model-00003-of-00008.safetensors",
610
- "language_model.model.layers.9.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
611
- "language_model.model.layers.9.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
612
- "language_model.model.layers.9.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
613
- "language_model.model.layers.9.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
614
- "language_model.model.layers.9.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
615
- "language_model.model.layers.9.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
616
- "language_model.model.layers.9.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
617
- "language_model.model.layers.9.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
618
- "language_model.model.layers.9.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
619
- "language_model.model.layers.9.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
620
- "language_model.model.layers.9.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
621
- "language_model.model.norm.weight": "model-00006-of-00008.safetensors",
622
- "multi_modal_projector.acoustic_linear_1.bias": "model-00007-of-00008.safetensors",
623
- "multi_modal_projector.acoustic_linear_1.weight": "model-00007-of-00008.safetensors",
624
- "multi_modal_projector.acoustic_linear_2.bias": "model-00007-of-00008.safetensors",
625
- "multi_modal_projector.acoustic_linear_2.weight": "model-00007-of-00008.safetensors",
626
- "multi_modal_projector.acoustic_norm.weight": "model-00007-of-00008.safetensors",
627
- "multi_modal_projector.semantic_linear_1.bias": "model-00007-of-00008.safetensors",
628
- "multi_modal_projector.semantic_linear_1.weight": "model-00007-of-00008.safetensors",
629
- "multi_modal_projector.semantic_linear_2.bias": "model-00007-of-00008.safetensors",
630
- "multi_modal_projector.semantic_linear_2.weight": "model-00007-of-00008.safetensors",
631
- "multi_modal_projector.semantic_norm.weight": "model-00007-of-00008.safetensors",
632
- "semantic_tokenizer_encoder.conv_layers.0.conv.conv.bias": "model-00007-of-00008.safetensors",
633
- "semantic_tokenizer_encoder.conv_layers.0.conv.conv.weight": "model-00007-of-00008.safetensors",
634
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
635
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
636
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
637
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
638
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
639
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
640
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.gamma": "model-00007-of-00008.safetensors",
641
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
642
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
643
- "semantic_tokenizer_encoder.conv_layers.0.stage.0.norm.weight": "model-00007-of-00008.safetensors",
644
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
645
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
646
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
647
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
648
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
649
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
650
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.gamma": "model-00007-of-00008.safetensors",
651
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
652
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
653
- "semantic_tokenizer_encoder.conv_layers.0.stage.1.norm.weight": "model-00007-of-00008.safetensors",
654
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
655
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
656
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
657
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
658
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
659
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
660
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.gamma": "model-00007-of-00008.safetensors",
661
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
662
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
663
- "semantic_tokenizer_encoder.conv_layers.0.stage.2.norm.weight": "model-00007-of-00008.safetensors",
664
- "semantic_tokenizer_encoder.conv_layers.1.conv.conv.bias": "model-00007-of-00008.safetensors",
665
- "semantic_tokenizer_encoder.conv_layers.1.conv.conv.weight": "model-00007-of-00008.safetensors",
666
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
667
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
668
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
669
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
670
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
671
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
672
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.gamma": "model-00007-of-00008.safetensors",
673
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
674
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
675
- "semantic_tokenizer_encoder.conv_layers.1.stage.0.norm.weight": "model-00007-of-00008.safetensors",
676
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
677
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
678
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
679
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
680
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
681
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
682
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.gamma": "model-00007-of-00008.safetensors",
683
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
684
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
685
- "semantic_tokenizer_encoder.conv_layers.1.stage.1.norm.weight": "model-00007-of-00008.safetensors",
686
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
687
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
688
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
689
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
690
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
691
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
692
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.gamma": "model-00007-of-00008.safetensors",
693
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
694
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
695
- "semantic_tokenizer_encoder.conv_layers.1.stage.2.norm.weight": "model-00007-of-00008.safetensors",
696
- "semantic_tokenizer_encoder.conv_layers.2.conv.conv.bias": "model-00007-of-00008.safetensors",
697
- "semantic_tokenizer_encoder.conv_layers.2.conv.conv.weight": "model-00007-of-00008.safetensors",
698
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
699
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
700
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
701
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
702
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
703
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
704
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.gamma": "model-00007-of-00008.safetensors",
705
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
706
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
707
- "semantic_tokenizer_encoder.conv_layers.2.stage.0.norm.weight": "model-00007-of-00008.safetensors",
708
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
709
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
710
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
711
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
712
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
713
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
714
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.gamma": "model-00007-of-00008.safetensors",
715
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
716
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
717
- "semantic_tokenizer_encoder.conv_layers.2.stage.1.norm.weight": "model-00007-of-00008.safetensors",
718
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
719
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
720
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
721
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
722
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
723
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
724
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.gamma": "model-00007-of-00008.safetensors",
725
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
726
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
727
- "semantic_tokenizer_encoder.conv_layers.2.stage.2.norm.weight": "model-00007-of-00008.safetensors",
728
- "semantic_tokenizer_encoder.conv_layers.3.conv.conv.bias": "model-00007-of-00008.safetensors",
729
- "semantic_tokenizer_encoder.conv_layers.3.conv.conv.weight": "model-00007-of-00008.safetensors",
730
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
731
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
732
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
733
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
734
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
735
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
736
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.gamma": "model-00007-of-00008.safetensors",
737
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
738
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
739
- "semantic_tokenizer_encoder.conv_layers.3.stage.0.norm.weight": "model-00007-of-00008.safetensors",
740
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
741
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
742
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
743
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
744
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
745
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
746
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.gamma": "model-00007-of-00008.safetensors",
747
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
748
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
749
- "semantic_tokenizer_encoder.conv_layers.3.stage.1.norm.weight": "model-00007-of-00008.safetensors",
750
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
751
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
752
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
753
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
754
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
755
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
756
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.gamma": "model-00007-of-00008.safetensors",
757
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
758
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
759
- "semantic_tokenizer_encoder.conv_layers.3.stage.2.norm.weight": "model-00007-of-00008.safetensors",
760
- "semantic_tokenizer_encoder.conv_layers.4.conv.conv.bias": "model-00007-of-00008.safetensors",
761
- "semantic_tokenizer_encoder.conv_layers.4.conv.conv.weight": "model-00007-of-00008.safetensors",
762
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
763
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
764
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
765
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
766
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
767
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
768
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.gamma": "model-00007-of-00008.safetensors",
769
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
770
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
771
- "semantic_tokenizer_encoder.conv_layers.4.stage.0.norm.weight": "model-00007-of-00008.safetensors",
772
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
773
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
774
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
775
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
776
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
777
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
778
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.gamma": "model-00007-of-00008.safetensors",
779
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
780
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
781
- "semantic_tokenizer_encoder.conv_layers.4.stage.1.norm.weight": "model-00007-of-00008.safetensors",
782
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
783
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
784
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
785
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
786
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
787
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
788
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.gamma": "model-00007-of-00008.safetensors",
789
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
790
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
791
- "semantic_tokenizer_encoder.conv_layers.4.stage.2.norm.weight": "model-00007-of-00008.safetensors",
792
- "semantic_tokenizer_encoder.conv_layers.5.conv.conv.bias": "model-00007-of-00008.safetensors",
793
- "semantic_tokenizer_encoder.conv_layers.5.conv.conv.weight": "model-00007-of-00008.safetensors",
794
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
795
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
796
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
797
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
798
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
799
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
800
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.gamma": "model-00007-of-00008.safetensors",
801
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
802
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
803
- "semantic_tokenizer_encoder.conv_layers.5.stage.0.norm.weight": "model-00007-of-00008.safetensors",
804
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
805
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
806
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
807
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
808
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
809
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
810
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.gamma": "model-00007-of-00008.safetensors",
811
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
812
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
813
- "semantic_tokenizer_encoder.conv_layers.5.stage.1.norm.weight": "model-00007-of-00008.safetensors",
814
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
815
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
816
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
817
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
818
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
819
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
820
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.gamma": "model-00007-of-00008.safetensors",
821
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
822
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
823
- "semantic_tokenizer_encoder.conv_layers.5.stage.2.norm.weight": "model-00007-of-00008.safetensors",
824
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear1.bias": "model-00007-of-00008.safetensors",
825
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear1.weight": "model-00007-of-00008.safetensors",
826
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear2.bias": "model-00007-of-00008.safetensors",
827
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn.linear2.weight": "model-00007-of-00008.safetensors",
828
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn_gamma": "model-00007-of-00008.safetensors",
829
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.ffn_norm.weight": "model-00007-of-00008.safetensors",
830
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.gamma": "model-00007-of-00008.safetensors",
831
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.mixer.conv.bias": "model-00007-of-00008.safetensors",
832
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.mixer.conv.weight": "model-00007-of-00008.safetensors",
833
- "semantic_tokenizer_encoder.conv_layers.5.stage.3.norm.weight": "model-00007-of-00008.safetensors",
834
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear1.bias": "model-00007-of-00008.safetensors",
835
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear1.weight": "model-00007-of-00008.safetensors",
836
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear2.bias": "model-00007-of-00008.safetensors",
837
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn.linear2.weight": "model-00007-of-00008.safetensors",
838
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn_gamma": "model-00007-of-00008.safetensors",
839
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.ffn_norm.weight": "model-00007-of-00008.safetensors",
840
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.gamma": "model-00007-of-00008.safetensors",
841
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.mixer.conv.bias": "model-00007-of-00008.safetensors",
842
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.mixer.conv.weight": "model-00007-of-00008.safetensors",
843
- "semantic_tokenizer_encoder.conv_layers.5.stage.4.norm.weight": "model-00007-of-00008.safetensors",
844
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear1.bias": "model-00007-of-00008.safetensors",
845
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear1.weight": "model-00007-of-00008.safetensors",
846
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear2.bias": "model-00007-of-00008.safetensors",
847
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn.linear2.weight": "model-00007-of-00008.safetensors",
848
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn_gamma": "model-00007-of-00008.safetensors",
849
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.ffn_norm.weight": "model-00007-of-00008.safetensors",
850
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.gamma": "model-00007-of-00008.safetensors",
851
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.mixer.conv.bias": "model-00007-of-00008.safetensors",
852
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.mixer.conv.weight": "model-00007-of-00008.safetensors",
853
- "semantic_tokenizer_encoder.conv_layers.5.stage.5.norm.weight": "model-00007-of-00008.safetensors",
854
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear1.bias": "model-00007-of-00008.safetensors",
855
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear1.weight": "model-00007-of-00008.safetensors",
856
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear2.bias": "model-00007-of-00008.safetensors",
857
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn.linear2.weight": "model-00007-of-00008.safetensors",
858
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn_gamma": "model-00007-of-00008.safetensors",
859
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.ffn_norm.weight": "model-00007-of-00008.safetensors",
860
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.gamma": "model-00007-of-00008.safetensors",
861
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.mixer.conv.bias": "model-00007-of-00008.safetensors",
862
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.mixer.conv.weight": "model-00007-of-00008.safetensors",
863
- "semantic_tokenizer_encoder.conv_layers.5.stage.6.norm.weight": "model-00007-of-00008.safetensors",
864
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear1.bias": "model-00007-of-00008.safetensors",
865
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear1.weight": "model-00007-of-00008.safetensors",
866
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear2.bias": "model-00008-of-00008.safetensors",
867
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn.linear2.weight": "model-00008-of-00008.safetensors",
868
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn_gamma": "model-00007-of-00008.safetensors",
869
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.ffn_norm.weight": "model-00007-of-00008.safetensors",
870
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.gamma": "model-00007-of-00008.safetensors",
871
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.mixer.conv.bias": "model-00008-of-00008.safetensors",
872
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.mixer.conv.weight": "model-00008-of-00008.safetensors",
873
- "semantic_tokenizer_encoder.conv_layers.5.stage.7.norm.weight": "model-00007-of-00008.safetensors",
874
- "semantic_tokenizer_encoder.head.conv.bias": "model-00008-of-00008.safetensors",
875
- "semantic_tokenizer_encoder.head.conv.weight": "model-00008-of-00008.safetensors",
876
- "semantic_tokenizer_encoder.stem.conv.conv.bias": "model-00007-of-00008.safetensors",
877
- "semantic_tokenizer_encoder.stem.conv.conv.weight": "model-00007-of-00008.safetensors",
878
- "semantic_tokenizer_encoder.stem.stage.0.ffn.linear1.bias": "model-00007-of-00008.safetensors",
879
- "semantic_tokenizer_encoder.stem.stage.0.ffn.linear1.weight": "model-00007-of-00008.safetensors",
880
- "semantic_tokenizer_encoder.stem.stage.0.ffn.linear2.bias": "model-00007-of-00008.safetensors",
881
- "semantic_tokenizer_encoder.stem.stage.0.ffn.linear2.weight": "model-00007-of-00008.safetensors",
882
- "semantic_tokenizer_encoder.stem.stage.0.ffn_gamma": "model-00007-of-00008.safetensors",
883
- "semantic_tokenizer_encoder.stem.stage.0.ffn_norm.weight": "model-00007-of-00008.safetensors",
884
- "semantic_tokenizer_encoder.stem.stage.0.gamma": "model-00007-of-00008.safetensors",
885
- "semantic_tokenizer_encoder.stem.stage.0.mixer.conv.bias": "model-00007-of-00008.safetensors",
886
- "semantic_tokenizer_encoder.stem.stage.0.mixer.conv.weight": "model-00007-of-00008.safetensors",
887
- "semantic_tokenizer_encoder.stem.stage.0.norm.weight": "model-00007-of-00008.safetensors",
888
- "semantic_tokenizer_encoder.stem.stage.1.ffn.linear1.bias": "model-00007-of-00008.safetensors",
889
- "semantic_tokenizer_encoder.stem.stage.1.ffn.linear1.weight": "model-00007-of-00008.safetensors",
890
- "semantic_tokenizer_encoder.stem.stage.1.ffn.linear2.bias": "model-00007-of-00008.safetensors",
891
- "semantic_tokenizer_encoder.stem.stage.1.ffn.linear2.weight": "model-00007-of-00008.safetensors",
892
- "semantic_tokenizer_encoder.stem.stage.1.ffn_gamma": "model-00007-of-00008.safetensors",
893
- "semantic_tokenizer_encoder.stem.stage.1.ffn_norm.weight": "model-00007-of-00008.safetensors",
894
- "semantic_tokenizer_encoder.stem.stage.1.gamma": "model-00007-of-00008.safetensors",
895
- "semantic_tokenizer_encoder.stem.stage.1.mixer.conv.bias": "model-00007-of-00008.safetensors",
896
- "semantic_tokenizer_encoder.stem.stage.1.mixer.conv.weight": "model-00007-of-00008.safetensors",
897
- "semantic_tokenizer_encoder.stem.stage.1.norm.weight": "model-00007-of-00008.safetensors",
898
- "semantic_tokenizer_encoder.stem.stage.2.ffn.linear1.bias": "model-00007-of-00008.safetensors",
899
- "semantic_tokenizer_encoder.stem.stage.2.ffn.linear1.weight": "model-00007-of-00008.safetensors",
900
- "semantic_tokenizer_encoder.stem.stage.2.ffn.linear2.bias": "model-00007-of-00008.safetensors",
901
- "semantic_tokenizer_encoder.stem.stage.2.ffn.linear2.weight": "model-00007-of-00008.safetensors",
902
- "semantic_tokenizer_encoder.stem.stage.2.ffn_gamma": "model-00007-of-00008.safetensors",
903
- "semantic_tokenizer_encoder.stem.stage.2.ffn_norm.weight": "model-00007-of-00008.safetensors",
904
- "semantic_tokenizer_encoder.stem.stage.2.gamma": "model-00007-of-00008.safetensors",
905
- "semantic_tokenizer_encoder.stem.stage.2.mixer.conv.bias": "model-00007-of-00008.safetensors",
906
- "semantic_tokenizer_encoder.stem.stage.2.mixer.conv.weight": "model-00007-of-00008.safetensors",
907
- "semantic_tokenizer_encoder.stem.stage.2.norm.weight": "model-00007-of-00008.safetensors"
908
- }
909
- }
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
quantize.py ADDED
@@ -0,0 +1,105 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ #!/usr/bin/env python3
2
+ import argparse
3
+ import os
4
+ import sys
5
+ import logging
6
+ import torch
7
+ from transformers import AutoProcessor, BitsAndBytesConfig, TorchAoConfig
8
+
9
+ # We need to bypass lazy-loader for VibeVoice classes as in main.py
10
+ try:
11
+ from transformers.models.vibevoice_asr.modeling_vibevoice_asr import VibeVoiceAsrForConditionalGeneration
12
+ except ImportError as e:
13
+ print(f"Error importing VibeVoice modeling: {e}", file=sys.stderr)
14
+ print("Please ensure the correct transformers version is installed.", file=sys.stderr)
15
+ sys.exit(1)
16
+
17
+ logging.basicConfig(
18
+ level=logging.INFO,
19
+ format="%(asctime)s [%(levelname)s] %(message)s",
20
+ datefmt="%Y-%m-%d %H:%M:%S"
21
+ )
22
+ logger = logging.getLogger(__name__)
23
+
24
+ def main():
25
+ parser = argparse.ArgumentParser(description="Quantize VibeVoice ASR model and save the serialized weights.")
26
+ parser.add_argument("--model_dir", type=str, default=os.environ.get("MODEL_DIR", "./repository"),
27
+ help="Path to the original unquantized model directory (default: ./repository or $MODEL_DIR)")
28
+ parser.add_argument("--output_dir", type=str, required=True,
29
+ help="Path where the quantized model should be saved (must be a new/empty directory)")
30
+ parser.add_argument("--format", type=str, choices=["int8", "int4", "fp8"], default="int8",
31
+ help="Quantization format (int8, int4, or fp8, default: int8)")
32
+
33
+ args = parser.parse_args()
34
+
35
+ if not os.path.exists(args.model_dir):
36
+ logger.error(f"Source model directory does not exist: {args.model_dir}")
37
+ sys.exit(1)
38
+
39
+ # Clean path resolution
40
+ args.model_dir = os.path.abspath(args.model_dir)
41
+ args.output_dir = os.path.abspath(args.output_dir)
42
+
43
+ if os.path.exists(args.output_dir) and os.path.exists(os.path.join(args.output_dir, "config.json")):
44
+ logger.warning(f"Output directory '{args.output_dir}' already contains a model config. "
45
+ f"Saving here will overwrite it and may leave orphan weight files.")
46
+ confirm = input("Do you want to proceed anyway? (y/N): ")
47
+ if confirm.lower() != 'y':
48
+ logger.info("Aborted by user.")
49
+ sys.exit(0)
50
+
51
+ # Configure quantization
52
+ if args.format == "int8":
53
+ logger.info("Configuring 8-bit Integer (BitsAndBytes) quantization...")
54
+ quantization_config = BitsAndBytesConfig(load_in_8bit=True)
55
+ elif args.format == "int4":
56
+ logger.info("Configuring 4-bit (NF4 BitsAndBytes) quantization...")
57
+ quantization_config = BitsAndBytesConfig(
58
+ load_in_4bit=True,
59
+ bnb_4bit_compute_dtype=torch.bfloat16,
60
+ bnb_4bit_use_double_quant=True,
61
+ bnb_4bit_quant_type="nf4"
62
+ )
63
+ elif args.format == "fp8":
64
+ logger.info("Configuring 8-bit Floating Point (TorchAO Float8 Weight-Only) quantization...")
65
+ try:
66
+ from torchao.quantization import Float8WeightOnlyConfig
67
+ except ImportError:
68
+ logger.error("torchao is not installed. Please run 'pip install torchao' to use FP8 quantization.")
69
+ sys.exit(1)
70
+ quantization_config = TorchAoConfig(Float8WeightOnlyConfig())
71
+
72
+ # Check CUDA availability
73
+ if not torch.cuda.is_available():
74
+ logger.error("CUDA is not available. BitsAndBytes quantization requires a GPU to perform the compression.")
75
+ sys.exit(1)
76
+
77
+ logger.info(f"Loading model from '{args.model_dir}' and quantizing to {args.format}...")
78
+ try:
79
+ # Load model
80
+ model = VibeVoiceAsrForConditionalGeneration.from_pretrained(
81
+ args.model_dir,
82
+ quantization_config=quantization_config,
83
+ torch_dtype=torch.bfloat16,
84
+ device_map="auto",
85
+ )
86
+
87
+ # Load processor
88
+ logger.info("Loading processor...")
89
+ processor = AutoProcessor.from_pretrained(args.model_dir)
90
+
91
+ # Save
92
+ logger.info(f"Saving quantized model and processor to '{args.output_dir}'...")
93
+ os.makedirs(args.output_dir, exist_ok=True)
94
+ model.save_pretrained(args.output_dir)
95
+ processor.save_pretrained(args.output_dir)
96
+
97
+ logger.info("Quantization completed successfully!")
98
+ logger.info(f"You can now point your FastAPI server to '{args.output_dir}' to load it instantly.")
99
+
100
+ except Exception as e:
101
+ logger.exception(f"Quantization failed: {e}")
102
+ sys.exit(1)
103
+
104
+ if __name__ == "__main__":
105
+ main()
requirements.txt CHANGED
@@ -7,3 +7,5 @@ torchaudio
7
  fastapi
8
  uvicorn
9
  requests
 
 
 
7
  fastapi
8
  uvicorn
9
  requests
10
+ bitsandbytes>=0.43.0
11
+ torchao>=0.6.0
tokenizer_config.json CHANGED
@@ -20,7 +20,8 @@
20
  "<|image_pad|>",
21
  "<|video_pad|>"
22
  ],
23
- "is_local": false,
 
24
  "model_max_length": 131072,
25
  "pad_token": "<|endoftext|>",
26
  "processor_class": "VibeVoiceAsrProcessor",
 
20
  "<|image_pad|>",
21
  "<|video_pad|>"
22
  ],
23
+ "is_local": true,
24
+ "local_files_only": false,
25
  "model_max_length": 131072,
26
  "pad_token": "<|endoftext|>",
27
  "processor_class": "VibeVoiceAsrProcessor",