← 资讯列表
45|毫秒推理延迟

斯坦福发布Octopus v2:手机端运行的AI Agent实现毫秒级推理

📅 2026/6/4 08:00:00👁 1 阅读⏱ 约 2 分钟

端侧Agent的里程碑

2026年6月4日,斯坦福大学NLP实验室在arXiv上发布论文,介绍了Octopus v2——一个专为移动设备优化的AI Agent模型。该模型仅有20亿参数,却能在iPhone 17和旗舰Android设备上以低于45毫秒的延迟完成函数调用。Octopus v2通过创新的功能令牌机制,将自然语言指令到API调用的映射过程压缩到单一前向推理步骤,避免了传统Agent模型需要多轮LLM调用的开销。

https://miro.medium.com/v2/resize:fit:1400/0*lITBgLfSWSJ5Q8Xr'/>

实际应用场景

研究团队展示了Octopus v2在多个真实场景中的表现:在Yelp上预订餐厅(7步操作自动完成)、在Spotify创建播放列表、在Google Calendar安排会议并自动与参与者协调时间。模型在标准Agent基准测试中达到78.3%的任务成功率,超过GPT-4o mini(71.2%),同时功耗仅为后者的1/200。论文一经发布即在AI社区引发热烈讨论,Hugging Face上模型下载量24小时内突破10万次。

← 返回资讯列表 AI8899 · 内容仅供学习参考