GitHub 雷达
首次出现 67 天前

openai/CLIP

CLIP是一个由OpenAI开发的对比学习模型,用于在图像和文本之间建立关联,能够根据图像预测最相关的文本描述,实现零样本图像分类。该模型基于PyTorch实现,采用视觉Transformer和文本Transformer双编码器结构,通过对比学习在大规模图像文本对上进行预训练。其核心亮点是无需针对特定任务微调即可直接使用,在ImageNet等基准上达到与ResNet50相当的零样本性能,适用于图像检索、跨模态搜索和少样本学习等场景。

近 7 日
+44
累计 Star
34.3k
Fork
4,048
近 30 日
+135
Star 趋势 · 50 个采集点
+1%
7 月 28 日9 月 21 日
语言Jupyter Notebook
分类AI/机器学习
最近提交3 月 26 日
创建时间12 月 16 日
首次收录7 月 28 日 · 自动扫描
README 摘要
CLIP是一个由OpenAI开发的对比学习模型,用于在图像和文本之间建立关联,能够根据图像预测最相关的文本描述,实现零样本图像分类。该模型基于PyTorch实现,采用视觉Transformer和文本Transformer双编码器结构,通过对比学习在大规模图像文本对上进行预训练。其核心亮点是无需针对特定任务微调即可直接使用,在ImageNet等基准上达到与ResNet50相当的零样本性能,适用于图像检索、跨模态搜索和少样本学习等场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开