AI Post Transformers

Ling and Ring 2.6 for Trillion-Scale Agents


Listen Later

This episode explores Inclusion AI’s Ling and Ring 2.6 technical report, which asks how a trillion-parameter model can stay fast, handle very long contexts, and remain dependable in multi-step agent workflows. It explains why agentic AI makes latency and token costs much more painful than in ordinary chat, especially when models must carry long instruction traces, tool outputs, and large working contexts through repeated reasoning loops. The discussion breaks down the report’s core architectural changes, including a Lightning Attention and MLA hybrid with a 7:1 layer mix, designed to reduce attention cost and KV-cache memory without sacrificing model quality. It also examines the practical significance of retrofitting an existing trillion-scale checkpoint through continued pretraining and staged migration techniques, making the episode especially interesting for listeners who want a concrete look at how frontier model design is shifting from raw scale toward deployable systems engineering.
Sources:
1. Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale — Ang Li, Ben Liu, Bin Han, Bin Hu, Bin Jing, Binbin Hu, Bing Li, Cai Chen, Caizhi Tang, Changxin Tian, Chao Huang, Chao Zhang, Chen Liang, Chen Qian, Chengfu Tang, Chengyao Wen, Chilin Fu, Chunwei Wu, Cong Zhang, Cunyin Peng, Daixin Wang, Dalong Zhang, Deng Zhao, Dingnan Jin, Dingyuan Zhu, Donghao Zhang, Fan Yuan, Fangzheng Zhao, Fanzhuang Meng, Feifan Wu, Feng Xu, Fengbin Fang, Gangshan Wang, Guodong Yang, Hailin Zhao, Haitao Wang, Haitao Zhang, Hanxiao Zhang, Hanzi Wang, Hao Dai, Hao Liu, Hao Qian, Hao Wu, Haoxiong Liu, Haoyu Xu, Heng Zhang, Hong Liu, Hongliang Zhang, Hongrui Liu, Hongxun Li, Hongzhi Ruan, Huaidong Xiong, Huihuang Zheng, Huikang Tang, Jia Guo, Jia Li, Jia Liu, Jiameng Wang, Jiaming Liu, Jiannan Shi, Jianping Wei, Jiaolong Yang, Jiapeng Wang, Jie Gao, Jie Wang, Jiewei Wu, Jin Yang, Jinjin Li, Jinjing Huang, Jinquan Sun, Jinyao Chen, Juanhui Tu, Jun Liu, Jun Mei, Jun Xu, Jun Zhou, Junjie Ou, Junnan Sipan, Junpeng Fang, Kaihong Zhang, Kaiqin Hu, Ke Shi, Kuan Xu, Kun Tang, Kunlong Chen, Lanyin Mei, Lei Chen, Lei Liang, Lei Xu, Li Tang, Liang Jiang, Liangcheng Fu, Lihui Zhang, Linfeng Shi, Lintao Ma, Liyuan Liu, Longfei Li, Longfei Zheng, Lu Liu, Lu Yu, Man Li, Meiqi Zhu, Meng Li, Mengjie Gao, Mengshu Sun, Mingming Yin, Mingyang Zhang, Mingyuan Fan, Nuo Xu, Pan Tang, Peijie Jiang, Peilong Zhao, Peng Lin, Pingping Liu, Qi Zuo, Qian Zhao, Qiang Cheng, Qianggang Cao, Qiaoben Bao, Qing Cui, Qingyuan Yang, Qitao Shi, Qiyin Huang, Qizheng Zhou, Quan Wan, Runyuan Zhao, Shaomian Zheng, Shaowei Wei, Shengnan Zhang, Shuaicheng Li, Shujie Li, Shuo Zhang, Sikang Bian, Tianchu Yao, Tiange Xu, Tianshu Wang, Ting Guo, Tinghao Wang, Tingwei Huang, Tong Zhao, Tongkai Yang, Wang Hong, Wanli Gu, Wei Lu, Weichang Wu, Weiguang Han, Weiquan Li, Wenbo Shen, Wenjing Fang, Wenzhi Tang, Xiang Shu, Xiao Shi, Xiaodong Yan, Xiaolu Zhang, Xiaopei Wan, Xiaqing Sun, Xin Zhao, Xingyu Lu, Xinxing Yang, Xinyao Tang, Xinyu Kong, Xinyu Liu, Xiong Xu, Xuan Sun, Xudong Han, Xudong Wang, Xujie Shen, Yalin Zhang, Yangyang Hou, Yankun Ren, Yao Zhao, Ye Chen, Yeyang Chen, Yibo Cao, Yifan Zuo, Yijie Chen, Ying Li, Yingjie Song, Yingxue Li, Yiqi Wang, Yixuan Sun, Yizhu Xiao, Yongfei Xu, Yu Liu, Yuchen Fang, Yue Gao, Yue Yu, Yue Zhang, Yuqi Zhang, Yuxiao He, Yuxiao Lu, Yuxin Tian, Yuxuan Li, Yuzhuo Fu, Zhankai Xu, Zhaoxin Huan, Zhenduo Zhang, Zhengke Gui, Zhengyu Huang, Zhenjun Ma, Zhenxuan Pan, Zheping Qu, Zhibo Zhu, Zhidong Fan, Zhigang Huangfu, Zhihao Wang, Zhiqiang Zhang, Zhizhen Liu, Zhuyan Zhou, Zibin Lin, Zihang Zeng, Zihao Wang, Zilong Wang, Ziqi Liu, Zitao Xuan, Zixuan Cheng, Zujie Wen, Zuoli Tang, 2026
http://arxiv.org/abs/2606.15079
2. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou, 2022
https://scholar.google.com/scholar?q=Chain-of-Thought+Prompting+Elicits+Reasoning+in+Large+Language+Models
3. Let's Verify Step by Step — Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe, 2023
https://scholar.google.com/scholar?q=Let%27s+Verify+Step+by+Step
4. CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning — Kehua Feng, Keyan Ding, Zhihui Zhu, Lei Liang, Qiang Zhang, Huajun Chen, 2025
https://scholar.google.com/scholar?q=CoT-Evo%3A+Evolutionary+Distillation+of+Chain-of-Thought+for+Scientific+Reasoning
5. Chain Of Thought Compression: A Theoretical Analysis — Juncai Li, Ru Li, Yuxiang Zhou, Boxiang Ma, Jeff Z. Pan, 2026
https://scholar.google.com/scholar?q=Chain+Of+Thought+Compression%3A+A+Theoretical+Analysis
6. Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning (https://arxiv.org/abs/2510.19338) — Ling Team et al., 2025
https://scholar.google.com/scholar?q=Every+Attention+Matters%3A+An+Efficient+Hybrid+Architecture+for+Long-Context+Reasoning+%28https%3A%2F%2Farxiv.org%2Fabs%2F2510.19338%29
7. Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention (https://arxiv.org/abs/2405.17381) — Zhen Qin et al., 2024
https://scholar.google.com/scholar?q=Various+Lengths%2C+Constant+Speed%3A+Efficient+Language+Modeling+with+Lightning+Attention+%28https%3A%2F%2Farxiv.org%2Fabs%2F2405.17381%29
8. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model (https://arxiv.org/abs/2405.04434) — DeepSeek-AI et al., 2024
https://scholar.google.com/scholar?q=DeepSeek-V2%3A+A+Strong%2C+Economical%2C+and+Efficient+Mixture-of-Experts+Language+Model+%28https%3A%2F%2Farxiv.org%2Fabs%2F2405.04434%29
9. Holistic Capability Preservation: Towards Compact Yet Comprehensive Reasoning Models (https://arxiv.org/abs/2504.07158) — Ling Team et al., 2025
https://scholar.google.com/scholar?q=Holistic+Capability+Preservation%3A+Towards+Compact+Yet+Comprehensive+Reasoning+Models+%28https%3A%2F%2Farxiv.org%2Fabs%2F2504.07158%29
10. Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model (https://arxiv.org/abs/2510.18855) — Ling Team et al., 2025
https://scholar.google.com/scholar?q=Every+Step+Evolves%3A+Scaling+Reinforcement+Learning+for+Trillion-Scale+Thinking+Model+%28https%3A%2F%2Farxiv.org%2Fabs%2F2510.18855%29
11. Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries (https://arxiv.org/abs/2409.12640) — Kiran Vodrahalli et al., 2024
https://scholar.google.com/scholar?q=Michelangelo%3A+Long+Context+Evaluations+Beyond+Haystacks+via+Latent+Structure+Queries+%28https%3A%2F%2Farxiv.org%2Fabs%2F2409.12640%29
12. HyperAttention: Long-context Attention in Near-Linear Time — Insu Han et al., 2023
https://arxiv.org/abs/2310.05869
13. MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling — MiniCPM Team / Wenhao An et al., 2026
https://arxiv.org/abs/2602.11761
14. Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning — Wenkai Yang et al., 2025
https://arxiv.org/abs/2502.18080
15. Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs — Mohammad Ali Alomrani et al., 2025
https://arxiv.org/abs/2507.02076
16. Anyprefer: An Agentic Framework for Preference Data Synthesis — Yiyang Zhou et al., 2025
https://arxiv.org/abs/2504.19276
17. Towards Comprehensive Preference Data Collection for Reward Modeling — Yulan Hu et al., 2024
https://arxiv.org/abs/2406.16486
18. AI Post Transformers: Affordable Large-Scale Decoding Through Model-System Co-Design — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-05-19-affordable-large-scale-decoding-through-e1d7ed.mp3
19. AI Post Transformers: DeepSeek-V4 and Practical Million-Token Context — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-04-25-deepseek-v4-and-practical-million-token-6f4de1.mp3
20. AI Post Transformers: Speculative Decoding in Real vLLM Serving — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-04-04-speculative-decoding-in-real-vllm-servin-6f4e2b.mp3
21. AI Post Transformers: Self-Improving Pretraining With Post-Trained Models — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-05-02-self-improving-pretraining-with-post-tra-e37460.mp3
22. AI Post Transformers: Agentic Discovery for Test-Time Scaling — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-05-12-agentic-discovery-for-test-time-scaling-f9a81f.mp3
23. AI Post Transformers: Nemotron 3 Super Hybrid Mamba-Transformer MoE — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-04-19-nemotron-3-super-hybrid-mamba-transforme-31ac75.mp3
24. AI Post Transformers: Kimi K2.5 and Visual Agent Swarms — Hal Turing & Dr. Ada Shannon, 2026
https://podcast.do-not-panic.com/episodes/2026-04-24-kimi-k25-and-visual-agent-swarms-7d04d7.mp3
Interactive Visualization: Ling and Ring 2.6 for Trillion-Scale Agents
...more
View all episodesView all episodes
Download on the App Store

AI Post TransformersBy mcgrof