Hugging Face 发布基因注释模型 Carbon-A 及 5.66 亿候选基因数据库

📡 Thomas Wolf(Hugging Face 联创/CSO)2026-10-08 23:38

Hugging Face 团队发布基因注释模型 Carbon-A及覆盖22617个物种的5.66亿候选基因数据库。

AI 深度解读

Hugging Face 联创 Thomas Wolf 在 X 上宣布 Carbon-A 基因注释模型及配套数据库,关注价值在于其试图用统一模型处理大规模、低注释覆盖率的物种基因组。

  • 帖文称数据库覆盖 22617 个物种,包含约 5.66 亿个候选基因。
  • 团队称模型可直接在 DNA 序列中定位基因,并开放模型与数据库。
  • 帖文提到团队与 Active Site、加州大学圣迭戈分校合作,在猫、鸡和拟南芥等物种中开展部分湿实验验证。
  • 研究团队称发现 239 个参考注释中缺失、但具有 RNA 证据的基因;这类结果仍需结合更广泛实验和独立注释体系评估。
  • Hugging Face 官方 GitHub 仓库显示,Carbon 系列属于开放的基因组基础模型,当前公开模型覆盖 500M、3B 和 8B 参数规模。
  • 影响/看点:若候选基因能在更多物种和实验条件下重复验证,该项目可能降低非模式生物基因注释的初始成本;实际价值取决于数据库质量、跨物种泛化能力和后续实验确认率。
  • 资料依据:
  • Thomas Wolf X 帖(2026-10-08):https://x.com/Thom_Wolf/status/2108220549268639992
  • Hugging Face Carbon 官方 GitHub 仓库(2026-05-22):https://github.com/huggingface/carbon

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手