5分钟上手CogVLM:同一张图榨出多样多模态训练样本
5分钟上手CogVLM同一张图榨出多样多模态训练样本【免费下载链接】CogVLMa state-of-the-art-level open visual language model | 多模态预训练模型项目地址: https://gitcode.com/gh_mirrors/co/CogVLM做视觉语言数据集时大多数人会撞上一堵墙每张图的描述都长得差不多样本量一断档就没辙了。这正是 CogVLM 做「多模态数据增强」想解的题——拿一张图当起点批量生成多角度描述、多轮视觉问答等新样本让数据不够不再是个借口。它到底解决了什么麻烦描述太同质模型学不会先说结论训练集里措辞模式单一模型学到的是套模板而不是看图。举个具体的你有 5 万张图但标注全是图中有XX、左边有YY这种句式。模型训练后只会填空你换个问法——一共几个有没有被挡住半截的——它就答不上来。第二个坑是问答数据只有单轮一问一答模型的多轮追问能力自然差。CogVLM 的产出形态能补上这两块同一张图它可以换风格重写描述先总后分、聚焦细节、口语化各来一遍也能围绕图做多轮视觉问答一问一答层层递进图文对应关系不会跑偏。这些输出直接就能当新样本入库。原理拆解图像和文本走两条路最后会合结论先给整个链路就是并行编码 → 拼接 → 交叉融合没有玄学。️ 图像过 ViT 视觉编码器ViT ≈ 模型的眼睛把图切成小块变成一串特征文本走常规的词嵌入每个词一个向量你熟悉的那套两条序列拼在一起、加上位置编码送进语言模型主干关键一步是视觉专家模块 ≈ 给语言模型装上的看图外挂文本特征通过交叉注意力去主动查询图像特征相当于模型边写边看而不是凭印象编重点看图中图像特征与文本特征会合的那一段以及交叉注意力所在层级——这是生成内容图不错位、文不飘的地方。效果对比遮挡场景最能拉开差距结论普通场景下两者差距不大一上遮挡、部分可见的复杂画面分晓就出来了。普通做法模型只数完全可见的物体被挡住的直接跳过数出来的总数偏小CogVLM能区分总数和完全可见数指出哪个物体只露了半截还附上推理链条对比两张图里的计数结果和解释文字就能看出能说出推理过程的模型在复杂场景下可靠多少。CogVLM 多模态增强最小运行路径5分钟见第一份结果结论别自己造轮子先跑通官方示例再说。克隆仓库后装上requirements.txt里的依赖进入 basic_demo/跑web_demo.pyGradio 页面或cli_demo_hf.py命令行版传同一张图把提示词依次换成描述这张图围绕它问三个问题再作答找出某个物体的位置对比三版输出git clone https://gitcode.com/gh_mirrors/co/CogVLM这个页面就是图 提示词进、增强样本出的全流程看完它你就清楚整条数据管道长什么样。再往深玩从 Demo 接到你自己的管道 composite_demo/ 里的对话与 Agent 演示demo_chat_cogvlm.py、demo_agent_cogagent.py可以直接当多轮对话数据的生成模板 核心封装在 utils/models/cogvlm_model.py图像预处理看utils/utils/vision.py、提示词模板在utils/utils/template.py接进自己的增强管道时照抄这两处最省事需要微调适配自己数据分布的再看finetune_demo/下的脚本即可最后回到开头那堵墙数据瓶颈往往不在图片数量而在每张图能换多少种说法。CogVLM 让同一张图撑出多种风格、多轮问答的新样本模型少背一点模板、多看一点图本身训练收益自然跟着走。【免费下载链接】CogVLMa state-of-the-art-level open visual language model | 多模态预训练模型项目地址: https://gitcode.com/gh_mirrors/co/CogVLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻