Redis 推出托管语义缓存 LangCache:可降低大模型 API 成本高达 90%
Redis 推出托管语义缓存服务 LangCache 公测版,通过匹配意图复用模型响应以降低 API 成本与延迟。
AI 深度解读
Redis 于 2026 年 9 月 10 日推出全托管语义缓存服务 LangCache 公共预览版,旨在通过语义相似度匹配替代重复的大模型推理,降低生产环境的推理成本与延迟。
- 与依赖文本精确匹配的传统缓存不同,LangCache 利用向量嵌入计算 Prompt 相似度,当新请求与历史记录匹配度达到设定阈值时直接返回已缓存的响应结果。
- 官方测试表明,该服务在常见客服与 RAG 问答场景下可节省高达 90% 的模型 API 成本,并在命中时实现最高 15 倍的响应加速。
- 服务通过 REST API 以及 Python、JavaScript SDK 接入,提供自定义向量模型、TTL 生存时间、淘汰策略以及内置监控面板等工程化配置。
- 影响/看点:若语义相似度阈值能在实际复杂业务中兼顾召回准确率与幻觉防范,该方案可能成为高并发 AI 问答系统的标配基础设施,有效抑制长尾同义查询带来的算力浪费。
- 资料依据:
- MarkTechPost(2026-09-10):https://www.marktechpost.com/2026/09/10/meet-redis-langcache-a-managed-semantic-cache-that-cuts-llm-api-costs-by-up-to-90-and-returns-cache-hits-up-to-15x-faster/
- Redis 官方技术文档(2026-09-10):https://redis.io/docs/latest/develop/ai/langcache/
本内容由 AI 生成,仅供参考,请注意甄别