Zentra

Development

0%

Skip to content
All Models
Coming Soonvisionmultimodaldocumentsocr

Zentra Vision

A vision-language model that understands images, diagrams, charts, and documents alongside text.

7.1B + ViT params
32,768 tokens context
Transformer + Vision Encoder
Coming Q4 2026

Technical Specifications

Parameters7.1B + ViT
Context32,768 tokens
ArchitectureTransformer + ViT
Vision336×336 patches
Layers32
Hidden Size4,096
Vocab128,000
LicenseApache 2.0

System Requirements

Minimum
RAM16 GB
VRAM8 GB
OSLinux, macOS, Windows
Recommended
RAM32 GB
VRAM16 GB
OSLinux, macOS, Windows

About

Zentra Vision extends the Zentra family with multimodal capabilities. It can process and reason about images alongside text, making it ideal for:

- Document understanding and OCR - Chart and diagram analysis - Visual question answering - UI/UX design feedback and generation - Medical imaging report generation

Get Zentra Vision

Download the GGUF weights for local inference, or try it in the playground.

Open SourceApache 2.0 LicenseHugging Face