Skylark Embedding Vision
ByteDance / 8K
ByteDance·8K context·Embedding
Multimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.