QuadTok:用于自回归图像生成的四叉树视觉分词器

📡 HuggingFace Daily Papers2026-10-07 08:00

提出四叉树视觉分词器QuadTok,按图像区域复杂度分配令牌,在保持重建质量的同时减少令牌数量。

AI 深度解读

论文提出 QuadTok,以四叉树替代固定二维网格或一维序列进行视觉分词,关注价值在于根据图像区域复杂度分配表示容量,并为自回归图像生成保留空间层级结构。

  • 分词器对细节丰富区域进行更细划分,对相对均匀区域保留较粗分辨率。
  • 在 ImageNet 训练设置下,相比固定的 256-token 网格,论文报告 ImageNet 上约节省 10% token,迁移到 COCO 时约节省 9%,同时保持相近重建保真度。
  • 四叉树结构提供了从父节点到子区域的自然生成顺序,作者据此训练了 947M 参数的 GPT 式生成模型。
  • 在 ImageNet 256×256 基准上,论文报告该模型达到 2.08 gFID,并展示了基于预先给定四叉树拓扑的零样本空间控制生成。
  • 影响/看点:如果 token 节省能在更大分辨率和多样数据上保持,QuadTok可能降低自回归图像模型的序列负担;但当前数字主要来自特定数据集、分辨率和模型配置,不能直接推导出普遍的推理效率提升。
  • 资料依据:
  • QuadTok论文(2026-10-07):https://arxiv.org/abs/2610.10497
  • QuadTok作者代码仓库(2026-10-08):https://github.com/myc634/QuadTok

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手