45|毫秒推理延迟
斯坦福发布Octopus v2:手机端运行的AI Agent实现毫秒级推理
端侧Agent的里程碑
2026年6月4日,斯坦福大学NLP实验室在arXiv上发布论文,介绍了Octopus v2——一个专为移动设备优化的AI Agent模型。该模型仅有20亿参数,却能在iPhone 17和旗舰Android设备上以低于45毫秒的延迟完成函数调用。Octopus v2通过创新的功能令牌机制,将自然语言指令到API调用的映射过程压缩到单一前向推理步骤,避免了传统Agent模型需要多轮LLM调用的开销。
实际应用场景
研究团队展示了Octopus v2在多个真实场景中的表现:在Yelp上预订餐厅(7步操作自动完成)、在Spotify创建播放列表、在Google Calendar安排会议并自动与参与者协调时间。模型在标准Agent基准测试中达到78.3%的任务成功率,超过GPT-4o mini(71.2%),同时功耗仅为后者的1/200。论文一经发布即在AI社区引发热烈讨论,Hugging Face上模型下载量24小时内突破10万次。
← 返回资讯列表
AI8899 · 内容仅供学习参考