DeepSeek 开源首个多模态模型 V4-Flash-Vision-Exp

📡 IT之家2026-08-31 19:35

DeepSeek 以 MIT 协议开源首款多模态实验模型 V4-Flash-Vision-Exp,支持图片输入并公开了完整推理实现。

AI 深度解读

深度求索(DeepSeek)于 2026 年 8 月 31 日在 Hugging Face 正式开源其首个原生支持图像输入的多模态实验模型 DeepSeek-V4-Flash-Vision-Exp,展示了其在轻量级多模态智能体领域的最新进展。

  • 该模型采用 MIT 开源协议,公开了权重文件、分词器、提示编码实现以及覆盖视觉编码器与 Aligner 等核心组件的 PyTorch 推理代码。
  • 模型支持 JPEG、PNG、GIF 与 WebP 等常见格式输入,可执行图表分析与截图标注识别等任务,且此前已于 8 月 21 日上线其官方 API。
  • 官方评测显示,该模型在纯文本任务上保持了与 V4-Flash 正式版一致的推理水平,而在视觉理解相关的智能体(Agent)基准测试中表现接近 Claude Opus-4.8。
  • 影响/看点:开源完整多模态推理代码降低了视觉智能体的开发与适配门槛,若能在实际复杂 UI 操作与多轮图文交互中保持稳定性,可能加速轻量级端到端多模态应用的部署落地。
  • 资料依据:
  • IT之家(2026-08-31):https://www.ithome.com/0/996/637.htm
  • Hugging Face(2026-08-31):https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手