Model overview
Qwen3.5Omni-modalQwen3.5-Omni-Plus is Qwen's latest omni-modal model. It supports text, image, audio, and audio-video understanding and interaction, more than 10 hours of audio understanding, over 400 seconds of 720P 1 FPS audio-video understanding, 60+ input audio languages, 30+ speech output languages, and structured audio-video understanding.
Company: AlibabaProvider: Alibaba Cloud
Model capabilities
Input modalityT
Output modalityT
Model experience✓
Function calling-
Structured output-
Web search-
Prefix completion-
Context cache✓
Batch inference✓
Fine-tuning-
Model pricing
Audio input$7.91/1M tokens
Text / image / video input$1.04/1M tokens
Text + audio output (text output is not charged)$31.79/1M tokens
Text output$5.97/1M tokens
Tool call pricing
Completions API $0.597/1K calls
Rate limits and context
Maximum input length192K
Context length256K
Maximum output length64K
RPM60
TPM100000
API reference
EndpointPOST /v1/chat/completions
SDKOpenAI-compatible
API code examples
from openai import OpenAI client = OpenAI( api_key="$WLROUTER_API_KEY", base_url="https://api.wlrouter.com/v1" ) response = client.chat.completions.create( model="qwen3.5-omni-plus", messages=[ {"role": "user", "content": "Reply with one short sentence."} ], max_tokens=32 ) print(response.choices[0].message.content)