Jina CLIP v2
FreeMultilingual vision search
FreeFree tier
Inputs: text, image
About Jina CLIP v2
Jina CLIP v2 is a multilingual vision-language model that supports 89 languages, enabling cross-modal retrieval between text and images. Built on XLM-RoBERTa and EVA-02, it provides state-of-the-art performance for feature extraction, sentence similarity, and multimodal search tasks. The model is open-source under a non-commercial license (CC BY-NC 4.0) and integrates with Transformers, ONNX, and sentence-transformers.
Key Features
Multilingual support for 89 languages
Dual encoder architecture (text + image)
Cross-modal retrieval between text and images
Feature extraction and sentence similarity
Compatible with Transformers, ONNX, and sentence-transformers
State-of-the-art accuracy on CLIP benchmarks
Pros & Cons
Pros
- Supports 89 languages for broad multilingual use
- Strong performance on cross-modal retrieval tasks
- Open-source with permissive CC BY-NC 4.0 license for research
- Easy integration with popular ML frameworks
Cons
- Non-commercial license restricts commercial applications
- Requires significant GPU resources for large-scale inference
- May underperform on languages with limited training data
Best For
Multilingual image and text searchCross-modal retrieval for multimodal datasetsVisual search and image captioningText-to-image and image-to-text retrievalSimilarity search and clustering for mixed media
FAQ
What is Jina CLIP v2?
It is a multilingual vision-language model that aligns text and images in a shared embedding space, supporting 89 languages for cross-modal retrieval and feature extraction.
What license does Jina CLIP v2 use?
The model is released under the Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0) license.
How many languages does Jina CLIP v2 support?
It supports 89 languages, including English, Chinese, Arabic, Hindi, and many more.