阶跃推出 Step Edge 端侧模型家族
阶跃星辰 7 月 12 日发布面向端侧部署的 Step Edge 模型家族,以“1+N”框架连接文本、视觉基础模型与 Audio、GUI、Gen 三类模块。 基础模型覆盖图像理解、GUI Grounding、工具调用、空间与视频理解;Audio 在本地处理音频理解与语音识别,官方给出的中文字错率约 3.1%、英文词错率约 3.6%;GUI 面向电脑和手机上的本地闭环操作。Gen 在 W8A16 设置下,文生图约需 3 秒,图像编辑约需 4.5 秒。 自研 Step Inference NPU 引擎的官方测试中,1024 token 文本输入约需 4.33 秒,768 分辨率图像理解约需 5.61 秒,30 秒音频输入约需 10.72 秒,预填充吞吐最高为 1395 token/s。官方同时注明,页面中的外部模型对比分数均为内部自测结果。