Expand description
Phi-3-Vision Model V2 - Vision-Language Model
This implements the Phi-3-Vision architecture which features:
- CLIP ViT vision encoder
- MLP projector to align vision/text embeddings
- Phi-3 decoder for language modeling
Supports: Phi-3-Vision-128k-Instruct