图片embedding微调记录
2026/9/11 12:22:39 网站建设 项目流程

用站内的美食+风景图片微调Qwen3-VL-2B-Embedding模型,

DINO是纯拉开单图的距离,训了。

如果有每个图所在的POI(店铺/景点)text信息,纯图对比学习,把这些POI信息融入:(实现了跨卡对比学习)

输入:图片A batch内正例:图片A的augment图 batch内负例:其他POI的图

其中,其他POI = 图片所在POI的其他POI,
为提升负例难度,将相似的其他POI作为负例:把 POI类目 相同的POI聚到一个batch里。

尝试了image2text生成式训练 然后取图片emb。

尝试了图文CLIP训练。

尝试了卡相似度阈值卡正负例:就是推理好的Base模型的embedding,在训练时算两两相似度,给正负例卡阈值分数。

尝试了用Qwen3.5多模态模型写提示词 推理选出高质量的站内图,训练。

都没能明显超越Base模型。

但Base-Emb和微调Emb融合的方法(两路emb各自检索完之后,召回列表加权求和,单路缺失则放弃),能比较稳定的超过Base-Emb的效果,虽然超过的不多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询