Mô hình vision-language đọc hiểu bức ảnh rồi sinh ra một câu mô tả. Hữu ích cho alt-text, caption mạng xã hội.
- Model
- Xenova/vit-gpt2-image-captioning
- Dung lượng
- ~70 MB
- Yêu cầu
- WebAssembly (mọi trình duyệt hiện đại)
- Dữ liệu gửi đi
- 0 byte
Đang nạp module imageCaption.js…