All Models

Vision Medium

ReasoningTool CallingAttachmentsStructured Output

Balanced multimodal model pairing a 1M-token context window with deeper reasoning for analysis, content creation, and tool use across text, image, audio, video, and PDF inputs.

Providers1
ReleasedMay 15, 2024
Input Modalitiestext, image, audio, video, pdf
Output Modalitiestext
Tarsk Usecoding

Available Providers (1)

ProviderModel IDInput CostOutput CostContextMax OutputDocs
Visparkvispark/vision-medium$4.21/MTok$12.63/MTok1M65.5K

Capabilities

Reasoning
Tool Calling
Attachments
Open Weights
Structured Output