LongCat-Flash-Omni Technical Report

Meituan LongCat Team; Bairui Wang; Bayan; Bin Xiao; Bo Zhang; Bolin Rong; Borun Chen; Chang Wan; Chao Zhang; Chen Huang; Chen Chen; Chen Chen; Chengxu Yang; Chengzuo Yang; Cong Han; Dandan Peng; Delian Ruan; Detai Xin; Disong Wang; Dongchao Yang; Fanfan Liu; Fengjiao Chen; Fengyu Yang; Gan Dong; Gang Huang; Gang Xu; Guanglu Wan; Guoqiang Tan; Guoqiao Yu; Haibo Qiu; Hao Lu; Hongbo Liu; Hongyu Xiang; Jiaheng Wu; Jian Yang; Jiaxing Liu; Jing Huang; Jingang Wang; Jinrui Ding; Juchao Jiang; Jun Kuang; Jun Wang; Junhui Mei; Ke Ding; Kefeng Zhang; Lei Chen; Liang Shi; Limeng Qiao; Liming Zheng; Lin Ma; Liuyang Guo; Liya Ma; Luying Sun; Man Gao; Mengshen Zhu; Miao Cao; Minliang Lin; Nuo Xu; Peng Shi; Qi Zhang; Qian Fang; Qian Wang; Qian Yang; Quanxiu Wang; Rongxiang Weng; Rongxin Guo; Ruoxuan Liang; Senbin Yang; Shanbo Xu; Shanglin Lei; Shengze Ye; Shimin Chen; Shuaiqi Chen; Shujie Hu; Shuo Li; Siqi Yang; Siyu Xu; Siyu Ren; Song Li; Songxiang Liu; Tianhao Bai; Tianye Dai; Wei Hong; Wei Wang; Weixiao Zhao; Wengang Cao; Wenlong Zhu; Wenlong He; Xi Su; Xi Nan; Xiaohan Zhao; Xiaohao Wang; Xiaoyu Zhao; Xiaoyu Wang; Xiaoyu Li; Xin Pan; Xin Chen; Xiusong Sun; Xu Xiang; Xudong Xing; Xuezhi Cao; Xunliang Cai; Yang Yang; Yanli Tan; Yao Yao; Yerui Sun; Yi Chen; Yifan Lu; Yin Gong; Yining Zhang; Yitian Chen; Yiyang Gan; Yuchen Tang; Yuchen Xie; Yueqian Wang; Yuewen Zheng; Yufei Zhang; Yufeng Zhong; Yulei Qian; Yuqi Peng; Yuqian Li; Yuwei Jiang; Zeyang Hu; Zheng Zhang; Zhengkun Tian; Zhiqing Hong; Zhixiong Zeng; Zhuqi Mi; Ziran Li; Ziwen Wang; Ziyi Zhao; Ziyuan Zhuang; Zizhe Zhao

arXiv:2511.00279·cs.MM·December 1, 2025

LongCat-Flash-Omni Technical Report

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen

PDF

Open Access 1 Models

TL;DR

LongCat-Flash-Omni is a large-scale, open-source omni-modal model with 560 billion parameters, capable of real-time audio-visual interaction through a novel curriculum-inspired training strategy and efficient multimodal modules.

Contribution

It introduces a scalable, efficient training scheme and architecture for a 560B parameter omni-modal model, advancing open-source multimodal AI capabilities.

Findings

01

Achieves state-of-the-art performance on omni-modal benchmarks.

02

Maintains over 90% of text-only training throughput.

03

Delivers competitive results across diverse modality-specific tasks.

Abstract

We introduce LongCat-Flash-Omni, a state-of-the-art open-source omni-modal model with 560 billion parameters, excelling at real-time audio-visual interaction. By adopting a curriculum-inspired progressive training strategy that transitions from simpler to increasingly complex modality sequence modeling tasks, LongCat-Flash-Omni attains comprehensive multimodal capabilities while maintaining strong unimodal capability. Building upon LongCat-Flash, which adopts a high-performance Shortcut-connected Mixture-of-Experts (MoE) architecture with zero-computation experts, LongCat-Flash-Omni integrates efficient multimodal perception and speech reconstruction modules. Despite its immense size of 560B parameters (with 27B activated), LongCat-Flash-Omni achieves low-latency real-time audio-visual interaction. For training infrastructure, we developed a modality-decoupled parallelism scheme…

Peer Reviews

No public reviews on file for this paper yet. If you reviewed it on a platform where reviews are public (OpenReview, ICLR, NeurIPS, ICML), you can paste yours below so the community can read it here.

Code & Models

Models

🤗
meituan-longcat/LongCat-Flash-Omni
model· 90 dl· ♡ 109
90 dl♡ 109

Videos

No videos yet. Explain this paper in a talk, walkthrough, or lecture? Add one.

Taxonomy

TopicsSpeech and Audio Processing · Multimodal Machine Learning Applications · Generative Adversarial Networks and Image Synthesis