Jina CLIP v2 logo

Jina CLIP v2

Free

Multilingual vision search

FreeFree tier
Inputs: text, image
Type
Open Source
Company
jinaai

About Jina CLIP v2

Jina CLIP v2 is a multilingual vision-language model that supports 89 languages, enabling cross-modal retrieval between text and images. Built on XLM-RoBERTa and EVA-02, it provides state-of-the-art performance for feature extraction, sentence similarity, and multimodal search tasks. The model is open-source under a non-commercial license (CC BY-NC 4.0) and integrates with Transformers, ONNX, and sentence-transformers.

Key Features

Multilingual support for 89 languages
Dual encoder architecture (text + image)
Cross-modal retrieval between text and images
Feature extraction and sentence similarity
Compatible with Transformers, ONNX, and sentence-transformers
State-of-the-art accuracy on CLIP benchmarks

Pros & Cons

Pros
  • Supports 89 languages for broad multilingual use
  • Strong performance on cross-modal retrieval tasks
  • Open-source with permissive CC BY-NC 4.0 license for research
  • Easy integration with popular ML frameworks
Cons
  • Non-commercial license restricts commercial applications
  • Requires significant GPU resources for large-scale inference
  • May underperform on languages with limited training data

Best For

Multilingual image and text searchCross-modal retrieval for multimodal datasetsVisual search and image captioningText-to-image and image-to-text retrievalSimilarity search and clustering for mixed media

FAQ

What is Jina CLIP v2?
It is a multilingual vision-language model that aligns text and images in a shared embedding space, supporting 89 languages for cross-modal retrieval and feature extraction.
What license does Jina CLIP v2 use?
The model is released under the Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0) license.
How many languages does Jina CLIP v2 support?
It supports 89 languages, including English, Chinese, Arabic, Hindi, and many more.