All Models

Vision Large

ReasoningTool CallingAttachmentsStructured Output

Most capable Vision model for complex reasoning, detailed media analysis, and structured output over a 1M-token context window.

Providers1
ReleasedMay 15, 2024
Input Modalitiestext, image, audio, video, pdf
Output Modalitiestext
Tarsk Usecoding

Available Providers (1)

ProviderModel IDInput CostOutput CostContextMax OutputDocs
Visparkvispark/vision-large$7.37/MTok$22.11/MTok1M65.5K

Capabilities

Reasoning
Tool Calling
Attachments
Open Weights
Structured Output