Skylark Embedding Vision
ByteDance / 8K
ByteDance·8K context·Embedding·Released Jun 28, 2025
Multimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.