Supported Models — AOT Mode¶
Models validated for AOT mode on Cloud AI 100 with vLLM.
Architecture compatibility
Models sharing the same architecture (e.g., all LlamaForCausalLM variants) are generally
compatible. The representative models below are explicitly validated, but other models of the
same architecture family may also work.
Text-Only Language Models¶
Quick start — Llama 3.1 8B with SpD
Multimodal / Vision-Language Models¶
Support varies by QPC mode (Single vs Dual). Dual QPC uses the kv_offload architecture where the vision encoder and language model run on separate device groups.
| Architecture | Model Family | Representative Models | Single QPC | Dual QPC |
|---|---|---|---|---|
| LlavaForConditionalGeneration | LLaVA-1.5 | llava-hf/llava-1.5-7b-hf | ||
| MllamaForConditionalGeneration | Llama 3.2 Vision | meta-llama/Llama-3.2-11B-Vision-Instruct, meta-llama/Llama-3.2-90B-Vision-Instruct | ||
| LlavaNextForConditionalGeneration | Granite Vision | ibm-granite/granite-vision-3.2-2b | ||
| Llama4ForConditionalGeneration | Llama-4-Scout | meta-llama/Llama-4-Scout-17B-16E-Instruct | ||
| Qwen2_5_VLForConditionalGeneration | Qwen2.5-VL | Qwen/Qwen2.5-VL-3B-Instruct | ||
| Qwen3VLForConditionalGeneration | Qwen3-VL | Qwen/Qwen3-VL-32B-Instruct | ||
| Qwen3VLMoeForConditionalGeneration | Qwen3-VL MoE | Qwen/Qwen3-VL-30B-A3B-Instruct |
Multimodal limitations
- Multimodal models use the
kv_offloadarchitecture (vision encoder on separate device group) - Cannot combine with speculative decoding
- See Multimodal Guide for configuration details
Embedding Models¶
| Architecture | Model Family | Representative Models |
|---|---|---|
| BertModel | BGE | BAAI/bge-base-en-v1.5, BAAI/bge-large-en-v1.5, BAAI/bge-small-en-v1.5, intfloat/e5-large-v2 |
| MPNetForMaskedLM | MPNet | sentence-transformers/multi-qa-mpnet-base-cos-v1 |
| RobertaModel | RoBERTa (Granite) | ibm-granite/granite-embedding-30m-english, ibm-granite/granite-embedding-125m-english |
| XLMRobertaForSequenceClassification | XLM-RoBERTa (Reranker) | BAAI/bge-reranker-v2-m3 |
| XLMRobertaModel | XLM-RoBERTa | ibm-granite/granite-embedding-107m-multilingual, ibm-granite/granite-embedding-278m-multilingual, intfloat/multilingual-e5-large |
Quick start — BGE embedding
Audio / Encoder-Decoder Models¶
| Architecture | Model Family | Representative Models |
|---|---|---|
| Whisper | Whisper | openai/whisper-tiny, openai/whisper-base, openai/whisper-small, openai/whisper-medium, openai/whisper-large, openai/whisper-large-v3-turbo |
Quantization Support¶
All text-only models listed above support:
| Quantization | Status | Notes |
|---|---|---|
| mxfp6 (compute) | Hardware-native, best throughput/quality balance | |
| mxint8 (KV cache) | Pair with mxfp6 for optimal config |
Notes¶
- Set
trust_remote_code=Truefor Falcon, Phi-3 family models - Pass
disable_sliding_windowfor Gemma family models when using vLLM
QEfficient Reference
The full validated model matrix (including quantization variants, SwiftKV, and PEFT/LoRA support) is maintained in the QEfficient documentation: Validated Models