Hello! My name is Lin Song (宋林). I am currently with Joy Future Academy, JD. Previously, I was a Research Scientist at Tencent AI Lab in Shenzhen, China. In July 2022, I received my PhD from the College of Artificial Intelligence at Xi’an Jiaotong University, advised by Jian Sun and Hongbin Sun.
My research focuses on multimodal foundation models, computer vision, image and video generation and editing, and machine learning.
Google Scholar/GitHub/Email
![]() |
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive DiffusionProject LeaderYicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song*, Maoquan Zhang, Hang Xu, Yukang Chen, et al. arXiv preprint, 2026 [paper][code][model][demo] |
![]() |
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and GenerationProject LeaderLin Song*, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, et al. Technical Report, 2026 [paper][code][model][demo] |
![]() |
From Prediction to Perfection: Introducing Refinement to Autoregressive Image GenerationCheng Cheng*, Lin Song*, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying ShanInternational Conference on Learning Representations (ICLR), 2026 [paper] |
![]() |
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and GenerationYicheng Xiao*, Lin Song*^, Rui Yang, Cheng Cheng, Zunnan Xu, Zhaoyang Zhang, Yixiao Ge, Xiu Li^, Ying ShanarXiv preprint, 2025 [paper][code] |
![]() |
MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPOYicheng Xiao, Lin Song^, Yukang Chen, Yingmin Luo, Yuxin Chen, Yukang Gan, Wei Huang, Xiu Li, Xiaojuan Qi, Ying ShanConference on Neural Information Processing Systems (NeurIPS), 2025 [paper][code][project] |
![]() |
LoRA-Gen: Specializing Large Language Model via Online LoRA GenerationYicheng Xiao*, Lin Song*, Rui Yang, Cheng Cheng, Yixiao Ge, Xiu Li^, Ying ShanInternational Conference on Machine Learning (ICML), 2025 [paper] |
![]() |
HaploVL: A Single-Transformer Baseline for Multi-Modal UnderstandingRui Yang, Lin Song^, Yicheng Xiao, Runhui Huang, Yixiao Ge, Ying Shan, Hengshuang Zhao^International Conference on Machine Learning (ICML), 2025 [paper][code] |
![]() |
MambaTree: Tree Topology is All You Need in State Space ModelYicheng Xiao*, Lin Song*^, Shaoli Huang, Jiangshan Wang, Siyu Song, Yixiao Ge, Xiu Li^, Ying ShanConference on Neural Information Processing Systems (NeurIPS), 2024 (Spotlight) [paper][code] |
![]() |
YOLO-World: Real-time Open-vocabulary Object DetectionTianheng Cheng*, Lin Song*^, Yixiao Ge, Wenyu Liu, Xinggang Wang, Ying ShanIEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024 [paper][code] |
![]() |
LoRA-Sparse: Low-Rank Approximation for Sparse Large Language ModelsLin Song*^, Yukang Chen*, Shuai Yang, Xiaohan Ding, Yixiao Ge, Ying-Cong Chen, Ying ShanIEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024 |
![]() |
Meta-Adapter: An Online Few-shot Learner for Vision-Language ModelCheng Cheng*, Lin Song*, Ruoyi Xue, Hang Wang, Hongbin Sun, Yixiao Ge, Ying ShanConference on Neural Information Processing Systems (NeurIPS), 2023 [paper][code] |
![]() |
GPT4Tools: Teaching Large Language Model to Use Tools via Self-instructionRui Yang*, Lin Song*^, Yanwei Li, Sijie Zhao, Yixiao Ge, Xiu Li, Ying ShanConference on Neural Information Processing Systems (NeurIPS), 2023 [paper][code] |
![]() |
BoxSnake: Polygonal Instance Segmentation with Box SupervisionRui Yang*, Lin Song*^, Yixiao Ge, Xiu Li^International Conference on Computer Vision (ICCV), 2023 [paper][code] |
![]() |
DBQ-SSD: Dynamic Ball Query for Efficient 3D Object DetectionJinrong Yang*, Lin Song*, Songtao Liu, Zeming Li, Xiaoping Li, Hongbin Sun, Jian Sun, Nanning ZhengInternational Conference on Learning Representations (ICLR), 2023 [paper][code] |
![]() |
Dynamic Grained Encoder for Vision TransformerLin Song*, Songyang Zhang*, Songtao Liu, Zeming Li, Hongbin Sun, Jian Sun, Nanning ZhengConference on Neural Information Processing Systems (NeurIPS), 2021 [paper] [code] |
![]() |
End-to-End Object Detection with Fully Convolutional NetworkJianfeng Wang*, Lin Song*, Zeming Li, Hongbin Sun, Jian Sun, Nanning ZhengIEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2021 [paper] [code] |
![]() |
Fine-Grained Dynamic Head for Object DetectionLin Song, Yanwei Li, Zhengkai Jiang, Zeming Li, Hongbin Sun, Jian Sun, Nanning ZhengConference on Neural Information Processing Systems (NeurIPS), 2020 [paper] [code] [slides] |
![]() |
Rethinking Learnable Tree Filter for Generic Feature TransformLin Song, Yanwei Li, Zhengkai Jiang, Zeming Li, Xiangyu Zhang, Hongbin Sun, Jian Sun, Nanning ZhengConference on Neural Information Processing Systems (NeurIPS), 2020 [paper] [code] [slides] |
![]() |
Learning Dynamic Routing for Semantic SegmentationYanwei Li, Lin Song, Yukang Chen, Zeming Li, Xiangyu Zhang, Xingang Wang, Jian SunIEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2020 (Oral) [paper] [code] [slides] |
![]() |
Learnable Tree Filter for Structure-preserving Feature TransformLin Song*, Yanwei Li*, Zeming Li, Gang Yu, Hongbin Sun, Jian Sun, Nanning ZhengConference on Neural Information Processing Systems (NeurIPS), 2019 [paper] [code] |
![]() |
TACNet: Transition-aware Context Network for Spatio-temporal Action DetectionLin Song*, Shiwei Zhang*, Gang Yu, Hongbin SunIEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2019 [paper] |
![]() |
GLNet: Global Local Network for Weakly Supervised Action LocalizationShiwei Zhang*, Lin Song*, Changxin Gao, Nong SangIEEE Transactions on Multimedia (TMM) [paper] |
![]() |
NIPM-sWMF: Toward Efficient FPGA Design for High-Definition Large-Disparity Stereo MatchingXuchong Zhang, Hongbin Sun, Shiqiang Chen, Lin Song, Nanning ZhengIEEE Transactions on Circuits and Systems for Video Technology (TCSVT) [paper] |
Joy Future Academy, JD
Areas: Multimodal Foundation Models, Image and Video Generation
Researcher, Present
Tencent AI Lab (Vision Computing Center)
Areas: Visual Perception and Multimodal Learning
Research Scientist, 2022.8 - 2025
Megvii (Face++)
Areas: Object Detection, Image Segmentation and Action Localization
Full Time Research Intern, 2019.5 - 2022.6
Research Intern, 2017.11 - 2019.5
School of Microelectronics, Xidian University
Areas: Integrated Circuit
Research Intern, 2017.07 - 2017.09
Reviewer: CVPR, ICCV, NeurIPS, ICLR, AAAI, TPAMI, IJCV, TMM, TCSVT
Seminar talk: "Rethinking Learnable Tree Filter for Generic Feature Transform", 2020 [slides]
LVIS Challenge (Workshop at ICCV 2021), 2022, 2nd Place
Streaming Perception Challenges (Workshop on Autonomous Driving at CVPR 2021), 2021, 1st
ActivityNet-AVA, 2018, 1st
OpenImage Object Detection, 2018, GOLD (solo)
National Undergraduate Electronics Design Contest, 2015, 1st
National Undergraduate Intelligent Car Competition, 2014, 1st