四个算力难题:HPC 与 AI 融合到底卡在哪一层
AI 生成摘要
茶思屋「算力会战」榜单一次性抛出分布式线性求解、稀疏矩阵混合精度、HPC+AI 实时训练、高阶 PDE 收敛加速四道题。本文只讲问题本身:为什么是这四道,它们共同的难点在哪。
此摘要由 AI 生成,仅供参考,观点与事实以正文为准。本文是问题侧的解读笔记。榜单转述自公开渠道,文中不复述任何声称的「破解效果」数字——那些多为自媒体推断,缺乏官方口径与第三方复现。
一、四道题的原始形状
按题目本身的表述,四道题分别卡在数值计算的四个不同环节:
- 大规模稀疏线性方程组的分布式迭代求解与预条件子自动优选 工业仿真(CFD、结构力学)内核最终都会归约到解一次大型稀疏线性系统。难点不在迭代格式,而在「给定矩阵,自动挑出合适的预条件子」——今天仍大量依赖专家手工调参。
- 高鲁棒性稀疏矩阵混合精度求解 混合精度(fp16/bf16 参与部分运算)能换吞吐和显存,但稀疏矩阵一旦病态,低精度会直接让迭代崩溃。要的是一边降精度一边保证不炸。
- HPC + AI 协同的实时训练 科学模型(气象、环境、航天测控)要求训练/推理与物理时间步同步推进,而不是离线批量。CPU 与 NPU 的算力如何同时喂满,是调度问题而不是模型问题。
- 高阶 PDE(偏微分方程)的混合精度收敛加速 高阶格式在湍流、声学、高超声速仿真里是刚需,精度阶数一高,混合精度的误差传播路径就变复杂,收敛性证明随之变难。
二、为什么是这四道
把这四题并列看,会发现问题选择的内在一致性:它们全是「求解器层」的问题,而不是「模型层」或「芯片层」的问题。
- 芯片层(NPU、超节点互连)华为这些年公开讲得很多。
- 模型层(大模型、多模态)是全行业热点。
- 中间的数值求解内核反而长期被 CUDA 生态和国外商业求解器(以及 OpenFOAM、SU2 这类开源 CFD 工具)的实际主导权压着。
也就是说,这四道题不是「最前沿」的问题,而是国产算力栈上最先漏水的地方:硬件买不到 / 追不上时,软件栈的每一分利用率都变成产能。
三、共同难点:误差可控性
四题里有三题直接涉及混合精度。它们共享同一个矛盾:
浮点精度是数值方法正确性证明的一部分,而不只是性能参数。
单精度迭代能不能收敛,取决于矩阵条件数、误差传播路径、迭代格式对扰动的敏感度。传统分析都建立在「舍入误差足够小可忽略」的前提上;一旦主动放大这个误差换性能,整套收敛性保证需要重建。这就是为什么这几道题在学术界也不是新问题,但工业界始终没有通用解——学术上能做特例分析,工程上要求对任意输入矩阵都稳定。
至于第一题的「自动优选」,本质是把一个 算法选择 问题转成 元学习 问题:用矩阵谱特征、稀疏结构作为输入,输出预条件子与迭代参数。这恰好是 AI 能插进 HPC 的少数几个位置之一,也解释了第三题为什么会和前两题一起出现。
四、一个可跟踪的判断标准
这四道题值不值得投入注意力,我建议看三个代理指标,而不是看任何一方的效果宣称:
- 有没有公开的基准算例集与参考实现。 没有可复现的题目,就没有真正的社区攻坚。
- 主流开源求解器是否合并相关补丁。 OpenFOAM、PETSc、Trilinos 的提交记录比新闻稿诚实。
- 论文里是否出现「在国产加速器上」的实测表格。 混合精度收敛性工作若只在 NVIDIA 平台上评估,说明栈仍未打通。
五、参考与延伸
- 榜单入口:黄大年茶思屋 https://www.chaspark.com/(站内「难题榜文 / 科技热点」板块)
- 关于第 6 期算力难题的第三方解读示例(注意:效果数字未经官方证实):https://blog.csdn.net/coreopt/article/details/160227039
- 开源 CFD 求解器 OpenFOAM,理解题 1/2 的实际负载:https://openfoam.org/
- 线性代数求解库 PETSc(预条件子生态现状):https://petsc.org/release/
本文首发于 Wentao's blog,永久链接:https://fanwentao.cn/posts/hpc-ai-four-problems/
评论