Are image embeddings invariant to rotation, cropping, and scaling? Upload an image and find out. Vision encoders run entirely in your browser — no server, no API key. Model blobs are cached via service worker after first download.
Drop an image here, or click to choose
Powered by Transformers.js (WebGPU/WASM). Models: CLIP (OpenAI, language-aligned), SigLIP (Google, language-aligned), and DINOv2 (Meta, self-supervised — no language). All computation happens locally. Model files cached via service worker. GitHub