Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding

StepFun: Bin Wang; Bojun Wang; Changyi Wan; Guanzhe Huang; Hanpeng Hu; Haonan Jia; Hao Nie; Mingliang Li; Nuo Chen; Siyu Chen; Song Yuan; Wuxun Xie; Xiaoniu Song; Xing Chen; Xingping Yang; Xuelin Zhang; Yanbo Yu; Yaoyu Wang; Yibo Zhu; Yimin Jiang; Yu Zhou; Yuanwei Lu; Houyi Li; Jingcheng Hu; Ka Man Lo; Ailin Huang; Binxing Jiao; Bo Li; Boyu Chen; Changxin Miao; Chang Lou; Chen Hu; Chen Xu; Chenfeng Yu; Chengyuan Yao; Daokuan Lv; Dapeng Shi; Deshan Sun; Ding Huang; Dingyuan Hu; Dongqing Pang; Enle Liu; Fajie Zhang; Fanqi Wan; Gulin Yan; Han Zhang; Han Zhou; Hanghao Wu; Hangyu Guo; Hanqi Chen; Hanshan Zhang; Hao Wu; Haocheng Zhang; Haolong Yan; Haoran Lv; Haoran Wei; Hebin Zhou; Heng Wang; Heng Wang; Hongxin Li; Hongyu Zhou; Hongyuan Wang; Huiyong Guo; Jia Wang; Jiahao Gong; Jialing Xie; Jian Zhou; Jianjian Sun; Jiaoren Wu; Jiaran Zhang; Jiayu Liu; Jie Cheng; Jie Luo; Jie Yan; Jie Yang; Jieyi Hou; Jinguang Zhang; Jinlan Cao; Jisheng Yin; Junfeng Liu; Junhao Huang; Junzhe Lin; Kaijun Tan; Kaixiang Li; Kang An; Kangheng Lin; Kenkun Liu; Lei Yang; Liang Zhao; Liangyu Chen; Lieyu Shi; Liguo Tan; Lin Lin; Lin Zhang; Lina Chen; Liwen Huang; Liying Shi; Longlong Gu; Mei Chen; Mengqiang Ren; Ming Li; Mingzhe Chen; Na Wang; Nan Wu; Qi Han; Qian Zhao; Qiang Zhang; Qianni Liu; Qiaohui Chen; Qiling Wu; Qinglin He; Qinyuan Tan; Qiufeng Wang; Qiuping Wu; Qiuyan Liang; Quan Sun; Rui Li; Ruihang Miao; Ruosi Wan; Ruyan Guo; Shangwu Zhong; Shaoliang Pang; Shengjie Fan; Shijie Shang; Shilei Jiang; Shiliang Yang; Shiming Hao; Shuli Gao; Siming Huang; Siqi Liu; Tiancheng Cao; Tianhao Cheng; Tianhao Peng; Wang You; Wei Ji; Wen Sun; Wenjin Deng; Wenqing He; Wenzhen Zheng; Xi Chen; Xiangwen Kong; Xianzhen Luo; Xiaobo Yang; Xiaojia Liu; Xiaoxiao Ren; Xin Han; Xin Li; Xin Wu; Xu Zhao; Yanan Wei; Yang Li; Yangguang Li; Yangshijie Xu; Yanming Xu; Yaqiang Shi; Yeqing Shen; Yi Yang; Yifei Yang; Yifeng Gong; Yihan Chen; Yijing Yang; Yinmin Zhang; Yizhuang Zhou; Yuanhao Ding; Yuantao Fan; Yuanzhen Yang; Yuchu Luo; Yue Peng; Yufan Lu; Yuhang Deng; Yuhe Yin; Yujie Liu; Yukun Chen; Yuling Zhao; Yun Mou; Yunlong Li; Yunzhou Ju; Yusheng Li; Yuxiang Yang; Yuxiang Zhang; Yuyang Chen; Zejia Weng; Zhe Xie; Zheng Ge; Zheng Gong; Zhenyi Lu; Zhewei Huang; Zhichao Chang; Zhiguo Huang; Zhirui Wang; Zidong Yang; Zili Wang; Ziqi Wang; Zixin Zhang; Binxing Jiao; Daxin Jiang; Heung-Yeung Shum; Xiangyu Zhang

arXiv:2507.19427·cs.LG·July 28, 2025

Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding

StepFun: Bin Wang, Bojun Wang, Changyi Wan, Guanzhe Huang, Hanpeng Hu, Haonan Jia, Hao Nie, Mingliang Li, Nuo Chen, Siyu Chen, Song Yuan, Wuxun Xie, Xiaoniu Song, Xing Chen, Xingping Yang, Xuelin Zhang, Yanbo Yu, Yaoyu Wang, Yibo Zhu, Yimin Jiang, Yu Zhou, Yuanwei Lu, Houyi Li

PDF

Open Access 10 Models

TL;DR

This paper presents Step-3, a cost-effective large language model system that employs novel model-system co-design techniques, significantly reducing decoding costs and increasing throughput for long-context tasks.

Contribution

Introduction of Step-3, a 321B-parameter LLM with innovative MFA and AFD techniques for hardware-efficient, low-cost decoding.

Findings

01

Decodes at 4,039 tokens/sec per GPU, outperforming DeepSeek-V3.

02

Reduces decoding costs compared to similar models, especially at longer contexts.

03

Achieves a new Pareto frontier for LLM decoding efficiency.

Abstract

Large language models (LLMs) face low hardware efficiency during decoding, especially for long-context reasoning tasks. This paper introduces Step-3, a 321B-parameter VLM with hardware-aware model-system co-design optimized for minimizing decoding costs. Step-3 innovates in two key dimensions: (1) A novel Multi-Matrix Factorization Attention (MFA) mechanism that significantly reduces both KV cache size and computation while maintaining high attention expressiveness, and (2) Attention-FFN Disaggregation (AFD), a distributed inference system that decouples attention and Feed-Forward Network (FFN) layers into specialized subsystems. This co-design achieves unprecedented cost efficiency: Step-3 significantly reduces theoretical decoding costs compared with models like DeepSeek-V3 and Qwen3 MoE 235B, with the gains widening at longer context. Step-3 achieves low cost while activating 38B…

Peer Reviews

No public reviews on file for this paper yet. If you reviewed it on a platform where reviews are public (OpenReview, ICLR, NeurIPS, ICML), you can paste yours below so the community can read it here.

Code & Models

Models

Videos

No videos yet. Explain this paper in a talk, walkthrough, or lecture? Add one.

Taxonomy

TopicsNatural Language Processing Techniques · Topic Modeling · Speech Recognition and Synthesis