* denotes equal contribution.
-
Format-Driven Automatic Pipeline Construction and Load Balancing for SpMM on GPUs
Kaige Zhang*, Tianyu Feng*, Xin You, Da Huo, Kejie Ma, Kelun Lei, Zhongzhi Luan, Yi Liu, Hailong Yang, Depei Qian
[SC 2026, Best Paper Finalist and Best Student Paper Finalist] The International Conference for High Performance Computing, Networking, Storage, and Analysis -
DiFlow: A System for Micro-Serving Text-to-Image Diffusion Workflows
Lingyun Yang*, Suyi Li*, Tianyu Feng, Xiaoxiao Jiang, Zhipeng Di, Weiyi Lu, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang
[SOSP 2026] The 32nd ACM Symposium on Operating Systems Principles, Prague, Czechia
[arxiv] -
FlashPS: Efficient Generative Image Editing with Mask-aware Caching and Scheduling
Xiaoxiao Jiang*, Suyi Li*, Lingyun Yang, Tianyu Feng, Zhipeng Di, Weiyi Lu, Guoxuan Zhu, Xiu Lin, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang
[EuroSys 2026] The 22nd European Conference on Computer Systems
[arxiv] [pdf] -
Exploiting Efficient Mapping and Pipelined Execution for Accelerating SpMV on Tensor Cores
Kaige Zhang, Hailong Yang, Xin You, Tianyu Feng, Yufan Xu, Zhongzhi Luan, Yi Liu, Depei Qian
[PPoPP 2026] The 31st ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming
[html] -
Exploiting Synchronization-aware Transformer for Aligning Large-Scale MPI Traces
Zhibo Xuan, Xin You, Hailong Yang, Haoran Kong, Jingqi Chen, Tianyu Feng, Zhongzhi Luan, Yi Liu, Depei Qian
[FCS] Frontiers of Computer Science, 21(5): 2105104
[html] -
Towards Efficient LLM Inference via Collective and Adaptive Speculative Decoding
Siqi Wang, Hailong Yang, Xuezhu Wang, Tongxuan Liu, Pengbo Wang, Yufan Xu, Xuning Liang, Kejie Ma, Tianyu Feng, Xin You, Ruihao Gong, Rui Wang, Zhongzhi Luan, Yi Liu, Depei Qian
[SC 2025] The International Conference for High Performance Computing, Networking, Storage, and Analysis, pp. 973-990
[html] [arxiv] -
SimTrace: Exploiting Spatial and Temporal Sampling for Large-Scale Performance Analysis
Zhibo Xuan*, Xin You*, Tianyu Feng, Hailong Yang, Zhongzhi Luan, Yi Liu, Depei Qian
[TACO 2025] ACM Transactions on Architecture and Code Optimization
[html] -
AtRec: Accelerating Recommendation Model Training on CPUs
Siqi Wang*, Tianyu Feng*, Hailong Yang, Xin You, Bangduo Chen, Tongxuan Liu, Zhongzhi Luan, Depei Qian
[TPDS 2024] IEEE Transactions on Parallel and Distributed Systems
[source code] [html] [pdf] -
Jigsaw: Accelerating SpMM with Vector Sparsity on Sparse Tensor Core
Kaige Zhang*, Xiaoyan Liu*, Hailong Yang, Tianyu Feng, Xinyu Yang, Yi Liu, Zhongzhi Luan, Depei Qian
[ICPP 2024] The 53rd International Conference on Parallel Processing
[source code] [html] [pdf] -
Exploiting Input Tensor Dynamics in Activation Checkpointing for Efficient Training on GPU
Jianjin Liao, Mingzhen Li, Hailong Yang, Qingxiao Sun, Biao Sun, Jiwei Hao, Tianyu Feng, Fengwei Yu, Shengdong Chen, Ye Tao, Zicheng Zhang, Zhongzhi Luan, Depei Qian
[IPDPS 2023] 2023 IEEE International Parallel and Distributed Processing Symposium
[source code] [html] [pdf] -
dgQuEST: Accelerating Large Scale Quantum Circuit Simulation through Hybrid CPU-GPU Memory Hierarchies
Tianyu Feng, Siyan Chen, Xin You, Shuzhang Zhong, Hailong Yang, Zhongzhi Luan, Depei Qian
[NPC 2021, Best Paper] Network and Parallel Computing: 18th IFIP WG 10.3 International Conference
[source code] [html] [pdf]