All Models

Vision Small

ReasoningTool CallingAttachmentsStructured Output

Fast, low-cost multimodal model for understanding text, images, audio, video, and PDFs, with tool calling and a 1M-token context window.

Providers1
ReleasedMay 15, 2024
Input Modalitiestext, image, audio, video, pdf
Output Modalitiestext
Tarsk Usecoding

Available Providers (1)

ProviderModel IDInput CostOutput CostContextMax OutputDocs
Visparkvispark/vision-small$1.05/MTok$3.16/MTok1M65.5K

Capabilities

Reasoning
Tool Calling
Attachments
Open Weights
Structured Output