Perplexity CEO:端云协同将成主流,本地智能体可降低 90% 推理成本

📡 Aravind Srinivas(Perplexity CEO)2026-08-27 03:29

Perplexity CEO 表示本地智能体硬件可作为请求网关,通过端云协同分流最高降低 90% 推理成本。

AI 深度解读

Perplexity 首席执行官 Aravind Srinivas 于 2026 年 8 月公开发表演讲与观点,阐述了本地边缘硬件与云端前沿大模型协同运作的多智能体架构趋势。

  • 边缘硬件作为 Token 流量入口:Srinivas 认为具备本地智能体算力的计算终端(如 DGX Spark 等设备)将承担云端大模型流量前置分流与预处理网关的角色。
  • 分层协同的数据分流逻辑:本地小型模型负责初步任务拆解、上下文清洗与初级推理,仅在遇到复杂规划与深度推理时将请求路由至远程前沿大模型。
  • 推理成本缩减预期:根据其探索数据,当前端云分工架构可节省约 50% 的云端 Token 消耗;未来目标是通过 90% 本地运算与 10% 云端协同,实现约 10 倍的综合推理成本降幅。
  • 影响/看点:这一构想指明了企业应对高昂云端推理开销的潜在演进路线,但该模式的成立取决于端侧轻量模型的规划能力能否稳定完成前置过滤而不降低任务达成率。
  • 资料依据:Aravind Srinivas 社交平台发布(https://x.com/AravSrinivas/status/2092695996262449567)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手