工业视觉踩坑实录(二十):缺陷样本只有50张?小样本检测的技术全景和真实落地坑
缺陷样本只有50张小样本检测的技术全景和真实落地坑摘要当缺陷样本只有50张甚至更少时传统视觉、有监督深度学习、GAN合成三条老路各有死穴。2026年技术路线全面更新Dinomaly2以8张/类正常图达到99.9% multi-class SOTAAnomalyDINO仍是1-shot工程首选FoundADICLR 2026打开基础模型新范式合成数据路线MvP-Diff、AnomalyPainter从「帮倒忙」进化到「真能帮忙」。但最关键的数字始终不变——论文精度到真实工厂普遍打七到八折。关于作者我接触视觉整整10年。机器视觉、烟草、煤矿等行业都有深度开发经验。从硬件选型、算法开发、模型训练到上位机开发及部署都在一线磨过。之前是多家公司人工智能团队的技术负责人。现在自己创业了还在继续做视觉落地这件事。作者说小样本缺陷检测这个话题之前行业里的共识还是「合成数据看起来像但机器不认」。但现在这个领域的变化大到我觉得必须系统梳理一遍。最大的变化是Dinomaly2——8张正常图跑出超越full-shot的精度这在工程上的意义太大了你不需要再让客户攒几百张正常样本8张就能起步。但变化归变化有一条铁律始终没变论文上的精度到真实工厂普遍打七到八折。99.9%的MVTec精度到了工厂大概率是75-85%。这个预期管理做得好不好直接决定项目是成功交付还是客户翻脸。这篇文章就是把这四条路传统视觉、有监督深度学习、合成数据、异常检测的完整经历摊开再配上2026年最新的技术方案让你少走弯路。但如果你问我最诚实的建议——如果你还在选方向尽量别碰纯缺陷检测。不是技术上做不到是验收这件事本身就是一个无底洞。缺陷的定义是模糊的漏检和误报之间永远没有一个双方都满意的平衡点。客户说你要做到95%以上等你做到95%了他又会拿出一个你从没见过的奇葩样本来挑战你。SOP行为检测至少有个明确的对错标准——步骤做了就是做了没做就是没做。缺陷检测没有这个标准每张图都可以争论这到底算不算缺陷。更狠的是缺陷检测项目往往有一个隐含的逻辑陷阱客户之所以找你是因为缺陷率低、样本少。样本少意味着算法难做缺陷率低意味着你很难在现场收集足够的验证数据。你的技术难度和验收难度都来自同一个原因。我写这篇文章不是为了劝退而是为了让每个想入坑的人知道自己在面对什么。如果你已经在这个坑里了后面的技术方案能帮你少走弯路。但如果你还在选方向认真想想有没有更好的选择。那是我第一次理解什么叫「缺陷样本只有50张」的绝望。之前接过一个钢丝绳缺陷检测的项目客户拿来一堆图说「就这些你看着搞」。我翻了翻断丝的8张磨损的12张锈蚀的15张变形的几张大图还算清晰剩下的模糊得跟拍虚了一样。50张。其中40张我还不敢说能拿来训练。我当时的反应跟大多数工程师一样先试传统视觉不行再上深度学习还不行就合成数据。结果每条路都走了一遍每条路都踩了不同的坑。这篇文章就是把这几条路的完整经历摊开再配上2026年最新的技术方案让你少走弯路。先给个结论如果你现在手里也是50张缺陷样本这种窘境按这个优先级选优先级方案样本需求精度MVTec AD工程成熟度推荐场景首推Dinomaly28张/类正常图99.9%multi-class⭐⭐⭐⭐多品类统一检测2026年新SOTA次推AnomalyDINO1张正常图96.6%1-shot⭐⭐⭐⭐⭐极低样本工程首选次推FoundAD1张正常图竞争性能multi-class⭐⭐⭐⭐新范式DINOv3支持ICLR 2026备选优化版PatchCore1-10张正常图1-shot接近SOTA⭐⭐⭐⭐full-shot300仍首选增强CFF适配器叠加上述方案在SOTA上**1.6% AUROC**⭐⭐⭐轻量插件提升现有方案合成MvP-Diff / AnomalyPainter少量真实样本有效提升下游检测⭐⭐⭐配合上述方案做数据增强前沿关注VLMDiff / AD-Copilot多模态数据多品类统一检测⭐⭐VLM扩散新范式待工程验证最关键的一个数字论文精度和真实工厂之间普遍存在15-25个百分点的精度差距。MVTec AD上99%的方案到了真实工厂往往只有75-85%。记住这个数字后面每条技术路线我都会用它来做现实校准。一、传统视觉时期 — 规则穷举的尽头钢丝绳这个场景理论上用传统视觉应该能搞定对吧断丝就是边缘断裂磨损就是纹理变化锈蚀就是颜色异常。我当时的思路也是这样先写规则。边缘检测找断丝Canny阈值调了三天发现断丝的灰度变化跟钢丝绳本身的纹理变化差不多。模板匹配找磨损不同规格的钢丝绳纹理差异太大一个模板只能管一种。锈蚀用HSV颜色空间过滤结果润滑油和锈蚀的颜色范围严重重叠。断丝、磨损、锈蚀、变形、绳股松散、直径变小…每一种缺陷都需要一套独立的处理逻辑而且彼此之间还会互相干扰。调了两周12条if-else在测试集上跑出来准确率不到60%。这让我想到了一个根本问题传统视觉的穷举式规则在缺陷种类少、特征稳定的场景下确实好用比如PCB板短路检测但一旦缺陷模式多样化规则的数量会爆炸式增长而且每加一条规则都可能影响之前的判断。这也是我后来总结的一个规律传统方法 vs 深度学习 vs GAN合成 vs 异常检测各有各的死穴技术路线能解决的问题死穴适合的样本量传统视觉边缘检测/模板匹配特征稳定的简单缺陷缺陷种类一多直接崩溃不需要训练样本但需要人工定义每条规则有监督深度学习任意复杂缺陷分类样本不够直接过拟合至少几百张标注样本GAN/扩散模型合成缺陷样本稀缺合成缺陷和真实缺陷差异大需要一定真实样本做基础异常检测PatchCore等只需要正常样本对未见过的复杂纹理敏感只需要正常样本不需要缺陷样本你看每条路都有明确的适用边界。问题在于我当时手里那个项目正好卡在每个方案的死穴上。二、深度学习时期 — 50张样本的过拟合陷阱传统视觉这条路走不通我自然想到了深度学习。50张缺陷样本能不能训练一个分类网络理论上不行实践上更不行。我硬着头皮试了结果验证集准确率99%测试集直接崩到40%出头。典型的过拟合。后来我把数据增强拉满旋转、翻转、亮度扰动、高斯噪声、随机裁剪各种花样全上了。有效果但有限。说到底数据增强是在已有样本的基础上做变换并不能真正增加「新的信息」。你翻来覆去就那几种变换方式模型很快就能记住。这让我想到了一个更根本的矛盾有监督方法需要的样本量和工业现场能提供的样本量之间差了一个数量级。客户为什么要找你做缺陷检测因为缺陷率很低一年可能就出几十个不良品。如果缺陷率高达10%甚至20%这个产线早该停了。所以你拿到的50张缺陷样本往往已经是客户攒了大半年的「家底」了。这个矛盾不解决有监督深度学习在小样本场景下就是死路。那能不能自己造缺陷样本呢三、GAN合成时期 — 看起来像但机器不认「合成缺陷」这个想法说实话当时我第一次想到的时候还挺兴奋的。不就是把正常图和缺陷图结合起来用生成模型学出缺陷的分布然后批量生成吗我用了当时比较流行的方案用GAN在正常产品图上合成缺陷区域。第一眼看效果还行。断丝确实看起来像断丝锈蚀也像锈蚀。但问题是模型不认。我把合成数据和真实数据混合训练发现一个很诡异的现象模型在合成数据上表现很好但在真实缺陷上反而更差了。后来我仔细分析了合成缺陷和真实缺陷的差异才搞明白怎么回事。合成缺陷的边界太干净了过渡太自然了纹理太规律了。而真实工厂的缺陷边缘是参差不齐的周围往往还有油污、氧化层、机械损伤的痕迹。模型在训练中学到的是「合成痕迹」的特征而不是「缺陷本身」的特征。这让我想到了一句当时写在笔记本上的话合成数据的问题不在于「看起来不像」而在于「分布不对」。人眼和机器的判断标准不一样。人觉得像不代表模型的特征空间里也像。综合多篇论文的结论也能验证这一点。DD-AugIEEE 2024和PreAugNetJIM 2021都证明合成数据需要非常精心的设计才能真正帮助检测随手合成反而可能帮倒忙。但是2026年这个领域有了质的飞跃后面会说。四、2026年最新方案全景这部分是技术核心我会把每条路线的精华数据摊开同时加上我自己的实战判断。Dinomaly2 — 2026年新SOTA从学术到工程的跨越论文Dinomaly2: One Dinomaly2 Detect Them AllarXiv 2510.17611CVPR 2025扩展版代码https://github.com/guojiajeremy/Dinomaly2Dinomaly2直接变成了我要首推的方案。核心变化太大了精度数据数据集设置Dinomaly2Dinomaly v1说明MVTec ADmulti-class99.9%99.6%multi-class新SOTAVisAmulti-class99.3%98.7%multi-class新SOTAMVTec AD8-shot98.7%—8样本/类超越full-shot模型VisA8-shot97.4%—8样本/类超越full-shot模型来源arXiv 2510.17611https://arxiv.org/abs/2510.17611最让我震惊的是那个8-shot数据——每类只用8张正常样本就超越了之前需要全部正常样本训练的模型。这意味着你不需要采集几百上千张正常图8张就能跑。更关键的是Dinomaly2是真正的「全光谱」方案同一套框架同时覆盖2D、多视角、RGB-3D、RGB-IR多模态检测支持单品类、多品类、few-shot全场景。12个benchmark上验证了通用性。在钢丝绳场景下的判断Dinomaly2的「少即是多」哲学只有Attention和MLP加上重建式框架理论上对周期性纹理如钢丝绳是友好的。但99.9%的论文精度到工厂估计77-85%这是必须提前跟客户沟通的预期。AnomalyDINO — 工程落地之王论文arXiv 2405.14529WACV 2025 (Oral)代码https://github.com/dammsi/AnomalyDINO已集成AnomalibAnomalyDINO仍然是工程首选。1-shot 96.6%的MVTec AD精度在极低样本场景下依然是竞争力最强的方案。它的核心优势没变训练-free不需要微调1张样本就能跑已集成Anomalib。今年新增的竞争对手FoundAD下面讲在多品类统一检测上有优势但单品类1-shot场景下AnomalyDINO仍然是标杆。精度数据数据集设置AnomalyDINO原ResNet PatchCore提升MVTec AD1-shot96.6%93.1%3.5pp来源WACV 2025 Open Access工程优势今年依然成立训练-free直接推理已集成Anomalib2026年最新版v0.3.223种算法边缘部署成熟在钢丝绳场景下油污和氧化层的「假异常」仍需阈值调优FoundAD — ICLR 2026基础模型的新视角论文Foundation Visual Encoders Are Secretly Few-Shot Anomaly DetectorsICLR 2026代码https://github.com/ymxlzgy/FoundAD来源arXiv 2510.01934OpenReview ICLR 2026这是今年最让我兴奋的新工作。核心洞察非常优雅大规模预训练的基础视觉编码器DINOv2、DINOv3等在训练过程中已经学到了「正常图像的通用分布」。图像中异常区域的多少直接和编码器提取的嵌入特征与正常分布的偏差相关。FoundAD的做法学习一个非线性投影算子将特征投射到自然图像流形上异常区域自然就被识别出来了。关键亮点支持多品类统一检测不需要为每个品类单独训练参数量远少于之前的方法支持DINOv3Meta最新的视觉基础模型ICLR 2026正式收录学术认可度高精度数据论文报告在MVTec AD和VisA上达到「竞争性能」competitive performance具体数字未在摘要中给出论文中展示定位精度优于LogSAD等基线方法。来源arXiv 2510.01934https://arxiv.org/abs/2510.01934我的判断FoundAD代表了一个新范式——与其设计复杂的异常检测框架不如更好地利用基础模型已经学到的知识。但目前精度数据不够详细建议关注但不急于替换AnomalyDINO作为工程首选。CFF适配器 — 插件式提升论文Calibrated Feature Fusion: Enhancing Few-Shot Industrial Anomaly Detection via Cross-Stage Representation AlignmentPMC 2026来源https://pmc.ncbi.nlm.nih.gov/articles/PMC13075268这是一个「小而美」的工作。CFF是一个轻量级适配器通过跨阶段表示对齐来增强特征融合。精度数据指标提升幅度数据集AUROC1.6%MVTec AD, VisAAP像素级4.1%MVTec AD, VisA适用设置1/2/4-shot全提升—来源PMChttps://pmc.ncbi.nlm.nih.gov/articles/PMC13075268关键在于它是在现有SOTA方法基础上的提升不是替代。你可以把CFF叠加上AnomalyDINO或PatchCore上额外获得1-4个百分点的提升。我的判断对于已经有基础方案的团队CFF是最小成本的提升手段。精度提升是确定的而且轻量不影响推理速度。合成数据路线2026版 — 从「帮倒忙」到「真帮忙」之前行业里的共识是合成数据「看起来像但机器不认」2026年这个局面正在改变。MvP-DiffPattern Recognition 2026论文MvP-Diff: Multivariate yet Precise Diffusion for Anomaly Images Synthesis and Segmentation来源Pattern Recognition, Vol. 177, 2026https://www.sciencedirect.com/science/article/abs/pii/S0031320326002591这个工作的核心创新是「多变量精确扩散」——同时合成异常图像和对应的分割标签。这意味着你不仅得到了合成缺陷图还自动获得了像素级标注。对于下游检测模型的训练来说这种「图文并茂」的合成数据质量远高于纯图像合成。AnomalyPainterAAAI 2026 Oral来源AAAI 2026https://ojs.aaai.org/index.php/AAAI/article/view/37501/41463VLLM视觉语言大模型 扩散模型的协同框架。核心思路是利用VLLM的常识生成合理的异常文本描述再匹配一个专业的纹理库Tex-9K75类8792个纹理资产最终通过ControlNet引导生成逼真的工业缺陷图像。这个思路比之前的纯扩散合成更靠谱——VLLM理解「什么缺陷是合理的」纹理库保证了物理真实性。VL-AnodiffICASSP 2026来源ICASSP 2026https://ieeexplore.ieee.org/document/11461878视觉-语言引导的扩散模型专攻few-shot场景下的异常合成。利用语言模型理解缺陷类型指导扩散模型生成更合理的缺陷样本。TF-IDGICCV 2025论文Training-Free Industrial Defect Generation with Diffusion Models来源ICCV 2025https://openaccess.thecvf.com/content/ICCV2025/papers/Xu_Training-Free_Industrial_Defect_Generation_with_Diffusion_Models_ICCV_2025_paper.pdf不需要任何模型重新训练的缺陷生成框架。三个关键模块特征对齐、自适应异常掩码、纹理保持。在VisA上实现了6.0% image-level AUROC和3.1% PRO的提升。我的判断2026年合成数据路线终于从「帮倒忙」进化到「真能帮忙」。MvP-Diff同时输出合成图标注AnomalyPainter用纹理库保证物理真实TF-IDG训练-free即插即用。但核心原则没变合成数据是补充不是替代最佳实践是「真样本高质量合成样本」混合。VLM扩散新范式 — VLMDiff与AD-CopilotVLMDiffWACV 2026论文VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion代码https://arxiv.org/abs/2511.08173来源WACV 2026https://ieeexplore.ieee.org/abstract/document/11492546将潜在扩散模型LDM与视觉-语言模型VLM结合做多品类统一的异常检测。VLM提供语义理解扩散模型提供像素级异常定位。AD-CopilotarXiv 2026论文AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison来源arXiv 2603.13779https://arxiv.org/abs/2603.13779基于MLLM多模态大语言模型的工业异常检测助手。核心创新是「视觉上下文比较」——不是每张图独立编码然后在语言空间比较而是用交叉注意力机制直接比较两张图的视觉特征差异。构建了Chat-AD数据集大规模工业异常检测多模态数据集在MMAD benchmark上达到82.3%准确率超越所有其他模型。我的判断VLM扩散是新范式方向但目前精度数据不够充分推理成本高适合研究关注。如果客户要求「能对话、能解释为什么判异常」AD-Copilot这类方案有独特价值。Omni-ADCVPR 2026 — 新benchmark来源CVPR 2026https://cvpr.thecvf.com/virtual/2026/poster/39148CVPR 2026引入了Omni-AD一个大而全的工业异常检测benchmark。MVTec AD系列数据集在圈内的地位类似于ImageNet在分类领域的地位已经快被「考烂了」。Omni-AD的出现意味着社区对更贴近真实工厂的数据集有强烈需求。工具链更新 — AnomalibAnomalib 在2025年10月发布了v2.2.0目前已更新到v0.3.2PyPI。关键变化已集成23种异常检测算法2026年数据支持OpenVINO边缘部署基于PyTorch Lightning训练流程标准化PatchCore、PaDiM、EfficientAD等主力方案开箱即用来源https://github.com/open-edge-platform/anomalib, https://pypi.org/project/anomalib/0.3.2我的判断Anomalib仍是工业异常检测的工程首选工具库。但要注意新算法Dinomaly2、FoundAD等还没有集成到Anomalib中需要从各自的GitHub仓库获取。五、论文精度 vs 工厂精度这部分是我最想说的——MVTec AD这个数据集已经被「考烂了」。顶级方法在这个数据集上的差距缩小到0.1个百分点以内像素级AU-PRO这不说明问题解决了而是说明这个数据集已经不能区分好坏了。新基准MVTec AD 2.0https://www.mvtec.com/research-teaching/datasets/mvtec-ad-2和今年CVPR 2026的Omni-AD更接近真实工厂引入了透明和重叠物体、暗场和背光照明、极小缺陷5像素、光照条件变化等挑战。但即便如此benchmark和真实工厂之间仍然有巨大的鸿沟挑战论文数据集真实工厂光照变化固定随时间/天气/日夜变化产品换型单一固定不同批次纹理有差异缺陷模糊清晰手机拍摄往往过曝/抖动/遮挡背景干扰干净产品复杂纹理、金属反光经验法则论文上的精度打八折是乐观估计打七折是合理估计。来自工程调研的真实数据Benchmark AUROC 99.8%对应真实工厂估计约85-92%AnomalyDINO 1-shot在MVTec上96.6%对应真实工厂估计约75-85%。Dinomaly2的99.9%论文对应真实工厂估计约77-85%。主因不变光照变化、纹理批次差异、缺陷定义模糊、实时性压力和域偏移。坦率地讲如果客户要求90%以上的准确率论文方案直接上线大概率会失望。这不是算法的问题是测试环境和生产环境的根本差异。六、各方案的推荐理由核心技术变化总结新增方案Dinomaly2从「一笔带过」升级为首推方案99.9% multi-class SOTA8-shot超越full-shotFoundADICLR 2026是全新的基础模型利用范式CFF适配器作为通用增强插件MvP-Diff、AnomalyPainter、VL-Anodiff等新合成数据方案VLMDiffWACV 2026、AD-Copilot等VLM扩散新范式方案地位变化Dinomaly2的多品类能力99.9% MVTec, 99.3% VisA使其在2026年超越AnomalyDINO成为综合推荐第一AnomalyDINO仍是工程首选1-shot场景但不再是绝对首推PatchCore在full-shot场景300样本仍有价值但小样本场景已被新方案超越合成数据路线从「不建议」升级为「可以做补充」仍在生效的旧方案AnomalyDINO的1-shot工程价值仍然成立PatchCore full-shot仍是300正常图场景的稳妥选择「论文精度打七到八折」的经验法则不变七、绝对不要做的事不要指望零样本方案直接上产线。零样本意味着完全没有「这个工厂的产品长什么样」的先验工业缺陷的异常模式千奇百怪靠预训练泛化是赌。Demo验证可以量产慎用。不要有监督深度学习从零训练50张缺陷样本。必过拟合没有例外。不要不做现场调研直接套论文最优方法。论文数据是受控环境工厂有各种你想象不到的挑战。不要完全相信论文的准确率数字。打八折是乐观估计打七折是合理估计。不要期望一个方案解决所有问题。组合拳才是正解。不要忽视合成数据的新进展。2026年的MvP-Diff和AnomalyPainter已经能提供高质量的合成缺陷标注合理使用可以显著提升下游检测效果。不要轻信客户的精度承诺。95%以上就行听起来很合理但缺陷检测的验收从来不是一道算术题。缺陷定义会变、判定标准会漂移、边界样本会层出不穷。签合同之前把验收标准锁死在具体样本集上不要留双方协商的活口。说到底50张缺陷样本不是世界末日。2026年的最新答案是如果你是多品类场景Dinomaly28张/类正常图99.9% MVTec这是当前最强大的统一方案如果你是单品类、极低样本AnomalyDINO1张正常图96.6% MVTec仍然是工程首选如果你想要前沿方案FoundADICLR 2026DINOv3支持关注基础模型新范式如果你需要额外提升CFF适配器叠加上述方案1.6% AUROC如果你有少量缺陷样本MvP-Diff或AnomalyPainter合成高质量数据与正常数据混合训练但实验室数据是起点不是终点真实工厂往往要打七到八折这是每个工业视觉工程师必须趟的坑。最靠谱的落地思路Dinomaly2或AnomalyDINO保底CFF增强合成数据MvP-Diff扩充现场增量学习。四层叠加50张缺陷样本的场景有戏。还有一点光源设计大于算法调优。好成像质量带来的精度提升往往超过换算法。这个优先级搞反了后面怎么调都是在给烂数据擦屁股。数据生成的这些方案理论上你已经可以自己跑通了但工业场景的合成数据不是装个模型跑几十张就完事的。纹理库适配、缺陷分布控制、合成样本和真实样本的混合比例每一个环节都需要针对你的产品反复调。如果你正好卡在「样本不够」这个环节上也欢迎找我聊聊。我们专门做工业场景的稀有数据生成帮过几个项目从几十张样本补到能训练的程度。不一定合适但聊一圈至少能帮你判断该走哪条路。相关阅读工业视觉入门检测工具清单2026版工业视觉踩坑实录六SOP行为检测用AI替你盯着工厂流水线工业视觉踩坑实录十五用第一性原理和最优错误率重新理解工业视觉来源链接Dinomaly2arXiv 2510.17611https://arxiv.org/abs/2510.17611CVPR 2025扩展版AnomalyDINOWACV 2025OralarXiv 2405.14529https://openaccess.thecvf.com/content/WACV2025/html/Damm_AnomalyDINO_Boosting_Patch-Based_Few-Shot_Anomaly_Detection_with_DINOv2_WACV_2025_paper.htmlFoundADICLR 2026arXiv 2510.01934https://github.com/ymxlzgy/FoundADCFF适配器PMC 2026https://pmc.ncbi.nlm.nih.gov/articles/PMC13075268MvP-DiffPattern Recognition 2026, Vol.177https://www.sciencedirect.com/science/article/abs/pii/S0031320326002591AnomalyPainterAAAI 2026 Oralhttps://ojs.aaai.org/index.php/AAAI/article/view/37501/41463VL-AnodiffICASSP 2026https://ieeexplore.ieee.org/document/11461878VLMDiffWACV 2026arXiv 2511.08173https://wacv.thecvf.com/Conferences/2026/AcceptedPapersAD-CopilotarXiv 2603.13779https://arxiv.org/abs/2603.13779TF-IDGICCV 2025https://openaccess.thecvf.com/content/ICCV2025/papers/Xu_Training-Free_Industrial_Defect_Generation_with_Diffusion_Models_ICCV_2025_paper.htmlOmni-ADCVPR 2026https://cvpr.thecvf.com/virtual/2026/poster/39148MAIA-D2026https://www.scitepress.org/Papers/2026/146291/146291.pdfPatchCore优化IEEE ETFA 2025https://blog.seavision-group.com/news/anomaly-detection-paper-etfaDinomaly v1CVPR 2025arXiv 2405.14325https://github.com/guojiajeremy/DinomalyMVTec AD 2.0https://www.mvtec.com/research-teaching/datasets/mvtec-ad-2Anomalibhttps://github.com/open-edge-platform/anomalib, https://pypi.org/project/anomalib/0.3.2Anomalib实战指南2026https://datature.com/blog/visual-anomaly-detection-with-anomalib-a-hands-on-guide-2026awesome-industrial-anomaly-detectionhttps://github.com/m-3lab/awesome-industrial-anomaly-detection

相关新闻

最新新闻

日新闻

周新闻

月新闻