test-models - a inference-optimization Collection

inference-optimization 's Collections

Granite 4 Small and Tiny Quantized Models

NVIDIA-Nemotron-3-Nano-30B-A3B Quantized Models

Qwen3-Next-80B-A3B Quantized Models

Mixed Precision Models

KV Cache Quantization

test-models

updated 3 days ago

inference-optimization/test_tencentbac_fastmtp

Updated 24 days ago • 38
inference-optimization/test_qwen3_next_mtp

Updated 24 days ago • 41
inference-optimization/Qwen3-Next-80B-A3B-Instruct_mtp_speculator

Text Generation • 2B • Updated 10 days ago • 58
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch3

2B • Updated 9 days ago • 18
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch1

2B • Updated 9 days ago • 13
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch2

2B • Updated 9 days ago • 10
inference-optimization/Qwen3-Next-80B-A3B-Instruct-GSM8K-MTP-finetuned

81B • Updated 3 days ago • 35

Note Qwen3-Next-80B with GSM8K-finetuned MTP head (+22.5% acceptance rate). Generated using speculators.