Glint AI Studio

Glint-VL-Video-8B

面向长视频理解的视觉语言模型

Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型,基于自研并开源的 LLaVA-OneVision 技术体系训练,可在长时序视频中识别关键事件、定位发生区间并提取有效证据,适用于视频审核、内容检索与过程分析。

开源技术体系LLaVA-OneVision 2.0

开放研究与自研模型共筑技术底座

研究成果覆盖 VLM、视觉基座、多模态嵌入、多模态 RAG、人脸识别与三维视觉方向。选择研究方向后,可继续查看对应代码、论文与项目主页。

VLM

开源

LLaVA-OneVision 2.0

统一图像视频的全帧率视觉语言大模型

  • 多模态大模型

VLM

开源

LLaVA-OneVision-1.5

训练测试数据集、训练代码和模型全开源的视觉语言大模型训练框架

  • 多模态大模型

VLM

AAAI 2026

ViCToR

利用视觉token重建提升多模态大模型的方法,提升多模态模型在精细视觉理解、图表与文档解析等任务上的表现

  • 多模态大语言模型

VLM

CVPR 2026

StreamingRVOS

基于大语言模型的流式参考视频分割方法,可对长视频进行实时、连续的指代目标分割,适用于视频分析、机器人感知等场景

  • 流式视频分割
  • 参考分割

全栈模型微调服务,让模型适配您的业务

提供从基础训练、参数高效微调到知识蒸馏的全栈模型优化服务,并通过客观评测和生产部署形成完整闭环。数据留在客户现场,能力沉淀在客户模型中。

模型训练

围绕行业数据和目标任务构建训练集、训练配方与版本基线,支持 VLM 4B、8B 模型训练。

  • 数据治理与多模态标注
  • 训练过程监控与断点续训
  • 模型版本与实验记录

模型微调

采用 SFT、LoRA、QLoRA 等方式,让通用模型快速掌握客户任务、行业知识和输出规范。

  • 低成本参数高效微调
  • 私有盲测与 A/B 对比
  • 效果、成本与交付周期可控

模型蒸馏

将大模型知识和业务推理能力迁移到更小模型,兼顾效果、推理速度和私有化部署成本。

  • 支持 32B 以下 LLM 蒸馏
  • 量化编译与推理优化
  • 云端、私有环境与边缘部署

模型优化交付流程

  1. 01
    数据准备

    数据治理与多模态标注,数据留在客户现场。

  2. 02
    模型优化

    训练 / 微调 / 蒸馏

  3. 03
    评测与对齐

    客观评测、私有盲测与 A/B 对比。

  4. 04
    部署与交付

    生产部署到云端、私有环境或边缘,能力沉淀在客户模型中。

把模型能力,交付到业务现场

城市治理依靠算法编排组合视频、图像与多模态能力;金融领域以云边端一体化重塑运营管控,并在本地完成材料智能处理。

Glint-VL-Video-8B / Glint-VL-SE-8B

城市管理视觉智能

融合 CV 模型与多模态大模型,以“感知—理解—研判—预警—治理”为主线,将分散视图资源变成可检索、可研判、可预警的业务信息。

  • Video-8B 负责长视频事件理解、时序定位与证据提取
  • SE-8B 强化重点事件、人员车辆与细粒度属性识别
  • 云边协同,形成时空研判与风险主动发现闭环
了解城市管理方案

Glint-VL-BK-8B

智慧金融

融合 CV 模型与多模态大模型,配合边缘计算节点构建云边端一体化方案,为运营、安防、内控与个人金融四类业务提供统一能力支撑,助力降本增效与数字化转型。

  • BK-8B 持续理解网点、金库与办公楼物理空间
  • 关联人员行为、重点事件、发生区域与关键证据
  • 支持视频巡检、事件检索与过程分析
了解智慧金融方案

现在联系我们,打造您的企业专属大模型

告诉我们您的业务场景、数据条件与部署要求,由原厂团队为您规划模型微调、评测与私有化部署路径。