开源让视觉语言大模型(以下称“VLM”)变得更容易获得。但把同一款大模型放进不同企业,问题很快就会变得具体。
VLM能够描述画面中的人员、车辆等对象,辨识它们的外观,理解它们的行为与相互关系。进入具体业务后,它还要按照企业的标准作出判断,比如哪些情况需要关注,什么属于异常,何时触发告警。
相同对象的同一行为,在不同企业、不同现场可能有完全不同的判断标准。这些知识通常不在公开数据集里,而在企业自己的图像、视频等视图数据,以及业务规则和使用经验中。要让VLM掌握它们,需要用真实的视图业务数据继续训练。
即日起,格灵深瞳正式面向企业提供VLM共研服务。模型研发团队将以 FDE 模式直接参与客户项目,结合客户的视图业务数据和具体任务,完成垂域VLM的场景实施可行性评估、领域微调、量化与部署。
在安防领域,先把垂域VLM跑通
这项服务的技术基础,来自格灵深瞳近几年在视觉基础大模型、视觉语言大模型和垂域大模型上的持续训练实践。
视觉基础大模型 GLINT-MVT 负责提取和表达图像、视频中的视觉信息,目前已迭代至支持图像、视频统一编码的 GLINT-MVT 2.0。在此基础上,多模态视觉语言模型 GLINT-VL 进一步理解画面内容、对象关系和事件。
视觉语言大模型 LLaVA-OneVision-1.5 和 LLaVA-OneVision-2.0,是 GLINT-VL 先后面向开源社区发布的两个版本。2025年,我们随LLaVA-OneVision-1.5 一并开放了模型、训练与测试数据、训练代码和评测体系。2026年5月发布的 LLaVA-OneVision-2.0 引入 GLINT-MVT 2.0,增强了模型对长视频、时序信息和空间关系的理解。
在推进视觉大模型研发和开源的同时,团队也在安防领域开展垂域VLM定制开发。
基于长期积累的行业数据,格灵深瞳发布了安防垂域VLM——Glint-VL-SE-8B。在人体、机动车和非机动车相关的69个外观属性上,Glint-VL-SE-8B 的平均平衡准确率(F1)比 Qwen3-VL-8B 高 9.1%;在倒地、肢体冲突、二轮车带人等治安、交通事件任务上高 32.6%。
安防是首个完成验证的垂域,围绕Glint-VL-SE-8B的多轮训练与迭代,团队完整验证了垂域视觉场景的可行性评估、大模型选型、长尾数据挖掘、稀缺数据扩增、训练样本构建、大模型微调、多维度评估、量化和部署等环节。此次开放的VLM共研服务,就建立在这些已经验证过的场景评估方法、数据生产方法、模型生产方法和工程实施经验上。
FDE 模式,模型研发直接面对业务场景
这项服务采用 FDE 模式开展。这里所说的 FDE,是一种由模型研发团队直接参与客户项目的协作方式。客户团队熟悉行业规则、数据链路和现有系统,格灵深瞳带入经过验证的垂域视觉场景评估方法和大模型生产能力,双方基于真实数据和具体任务,共同完成垂域模型开发。
垂域的视觉类任务只靠一份需求文档,往往难以把判断标准讲清楚。VLM的一条错例究竟来自模型识别偏差(视觉偏差),还是业务规则没有定义清楚(语义偏差),需要把原始画面、需求文档、标注结果、任务提示词、模型参数和推理表现放在一起进行根因分析。项目开始前,双方先要明确现有VLM的能力边界,判断微调是否必要。
共研项目先从场景可行性评估和POC验证开始。格灵深瞳模型研发团队会梳理客户现有的图像、视频数据链路、算法管线、实际效果和业务评测集,判断当前场景、数据和资源是否具备实施条件,并将业务逻辑转化为VLM可以学习的训练样本和反映真实业务要求的评测标准。
技术路径得到验证后,我们将协同客户算法团队开展数据生产、业务评测集构建和模型微调实验。模型选择以客户业务评测效果为主要依据,同时参考公开评测结果,优选出上线模型。在适配具体任务的同时,兼顾模型的基本泛化能力。
确定上线模型后,团队将在客户环境中完成模型量化与部署,并按约定交付训练后的模型及使用权、评测报告和部署包。后续系统集成由客户结合自身业务架构完成,具体交接方式根据项目需要确定。
不同企业的数据、任务和判断标准各不相同,最终交付的VLM也会有所差异。格灵深瞳会复用已经验证的场景评估、数据生产、模型生产、量化与部署经验,再结合客户的垂域场景完成模型微调。这样,训练方法和工程流程不必每次从零开始,模型又能适配各自的业务需求。
现阶段,该服务面向已有明确视觉场景需求、拥有视觉算法团队和必要算力条件,并已建立图像、视频数据积累及治理链路的企业。