天津职业技术师范大学 · 计算机科学与技术(2023–2027)。 ASC 世界大学生超算竞赛(ASC25/26)国际二等奖 ×2 核心成员:8 节点 Xeon 集群 Linpack 达理论峰值 95.6%、HPCG 建立 Roofline 访存视角、4000W 功耗约束异构集群、流水线提速 18.6%。开源维护 3 个仓库、独立完成离线 OCR 与全栈系统 —— 点击任意项目卡片查看完整技术详情。
ASC 超算竞赛(团队赛)八项可量化系统级优化 —— 每一项来自 控制变量实验 + 实测数据。
ASC 竞赛完整工程链路,逐项映射 AI Infra 能力。点击卡片查看完整详情(方法 · 实测数据 · 图表 · AI Infra 迁移)。 * 竞赛为团队项目,以下为本人负责并主导的子系统成果。
3 个 GitHub 开源仓库 + 本地独立项目。点击卡片打开项目详情:背景 · 我的职责 · 技术拆解 · 关键数据。 本地项目源码不公开,欢迎邮件索取 demo。
比单点成绩更重要的是 不依赖具体硬件的调优流程 —— 每一步都有 AI Infra 中的等价物。
竞赛 × 科研 × 教学创新,三个维度交叉验证工程与算法能力。
《A Novel Infrared and Visible Image Fusion Method for Pig-Body Multi-Feature Detection》· Engineering Applications of Artificial Intelligence, 2026
天津职业技术师范大学代表队 · 算力优化核心成员,两届累计贡献团队 40%+ 核心代码
密立根油滴实验自动化测量系统(主导开发),纳入学校《大学物理实验》创新教学案例
强度来自真实项目里「从零啃下来」的经验 —— 不是课程清单。
我理解 AI Infra 与 HPC 在底层是相通的 —— 都是在给定的算力、带宽、功耗约束下,把有效吞吐做到最大。这也是我既做超算、又做 Agent 与 OCR 的原因:底层都是「资源约束下的效率工程」。
现在正把 HPC 方法论迁移到大规模训练与推理:补 NCCL 集合通信、Megatron-LM / DeepSpeed 并行配置、 Nsight / nsys / DCGM profiling、vLLM / TensorRT-LLM 推理实践;同时用 Agent 定制与离线 OCR 保持对应用层的敏感度。
工作原则:每个数字可溯源、每次优化标注边界、失败也记录 —— 本页所有数据遵循同一准则。