2027 届应届 · AI Infra / HPC / CV · 求职中

仇天赐 QIU TIANCI

⚡ 高性能计算 / AI 基础设施

天津职业技术师范大学 · 计算机科学与技术(2023–2027)。 ASC 世界大学生超算竞赛(ASC25/26)国际二等奖 ×2 核心成员:8 节点 Xeon 集群 Linpack 达理论峰值 95.6%、HPCG 建立 Roofline 访存视角、4000W 功耗约束异构集群、流水线提速 18.6%。开源维护 3 个仓库、独立完成离线 OCR 与全栈系统 —— 点击任意项目卡片查看完整技术详情

HPC · 性能工程 GPU / CUDA / TensorRT MPI · Slurm · Apptainer PyTorch · OpenCV · YOLO React · Node · TypeScript
benchmark · 实测记录
0 TFLOPS
Linpack · 8 节点实测
Rmax · Xeon 8358 ×8
0%
达理论峰值 Rpeak
N=343,673 · 16×32
0%
4→8 节点强扩展效率
超线性 · 2.023×
0×
HPCG 局部域维度搜索
nx 16 vs 128 · Roofline
0%
BLAS 算子库选型提升
MKL vs OpenBLAS
0%
流水线端到端提速
64 核 · 60 步 DAG
数据源:asc_competition/q2/ 原始输出 · 全部可核验
SCROLL
/ 01

核心成果一览

ASC 超算竞赛(团队赛)八项可量化系统级优化 —— 每一项来自 控制变量实验 + 实测数据

0%
单节点峰值效率
睿频超基频 → Rpeak 保守下界
0%
进程网格拓扑收益
P×Q 8×16 vs 32×4
0%
分块 NB 参数收益
384 vs 192 · 凸函数实测
0×
双卡 A800 加速比
并行效率 91.7%
0×
HPCG GPU vs CPU
A800 116.65 vs CPU 20.71
0×
HPCG 1→6 节点扩展
扩展效率 84.3%
0 W
4000W 约束内功耗
动态调配 · GPU 模式封顶
0 h/年
流水线优化年省机时
单轮 −46.5 min · 日更估算
/ 02

项目实证 — HPC / AI Infra

ASC 竞赛完整工程链路,逐项映射 AI Infra 能力。点击卡片查看完整详情(方法 · 实测数据 · 图表 · AI Infra 迁移)。 * 竞赛为团队项目,以下为本人负责并主导的子系统成果。

/ 03

作品库 & 开源

3 个 GitHub 开源仓库 + 本地独立项目。点击卡片打开项目详情:背景 · 我的职责 · 技术拆解 · 关键数据。 本地项目源码不公开,欢迎邮件索取 demo。

/ 04

方法论:可迁移的性能调优 SOP

比单点成绩更重要的是 不依赖具体硬件的调优流程 —— 每一步都有 AI Infra 中的等价物。

第 8 步最容易被省略,却是「跑过分」与「做过性能优化」的分水岭。 先算子效率 → 再通信 overlap → 最后调度。
/ 05

论文与荣誉

竞赛 × 科研 × 教学创新,三个维度交叉验证工程与算法能力。

SCI · Q1 · EAAI

SCI 一区论文(第二作者)

《A Novel Infrared and Visible Image Fusion Method for Pig-Body Multi-Feature Detection》· Engineering Applications of Artificial Intelligence, 2026

图像融合 · 目标检测 · 农业视觉
2025 · 2026

ASC 世界超算竞赛 · 国际二等奖 ×2

天津职业技术师范大学代表队 · 算力优化核心成员,两届累计贡献团队 40%+ 核心代码

HPC · 集群架构 · 性能工程
全国一等奖

全国大学生物理实验竞赛 · 一等奖

密立根油滴实验自动化测量系统(主导开发),纳入学校《大学物理实验》创新教学案例

CV 落地 · 自动化测量
/ 06

技能栈

强度来自真实项目里「从零啃下来」的经验 —— 不是课程清单。

高性能计算 / 性能工程

HPL 20.36 TFLOPS · 95.6% Rpeak · HPCG 3.52×
EXPERT · 92核心方向
Intel MKL / OpenBLASAVX-512 / SIMDMPI / OpenMPIRooflinecpuset / NUMA

GPU 异构计算 / 推理部署

A800 容器化基准 · AlphaFold3 推理 · TensorRT
ADVANCED · 86求职主方向
CUDA CTensorRT / ONNXNCCL(补强中)FP16 / INT8

集群架构 / 调度 / 容器

IB+RoCE 双网 · 4000W 功耗预算
ADVANCED · 84
SlurmApptainerDockerSnakemakeLinux 调优

计算机视觉 / 图像处理

SCI 一区融合算法 · OCR · 目标检测落地
EXPERT · 90论文实证
PyTorchOpenCVYOLO图像融合OCR 流水线

工程与后端

数据流水线 → 线上服务部署运维
ADVANCED · 82
Python / C / C++Node.jsNginxMySQLLinux

Agent / LLM 应用

Qrush-Agent 定制 · OCR + RAG 合规比对
LEARNING · 78近期主线
deepseek-harnessRAGDify/FastGPTElectron
/ 07

关于我

我理解 AI Infra 与 HPC 在底层是相通的 —— 都是在给定的算力、带宽、功耗约束下,把有效吞吐做到最大。这也是我既做超算、又做 Agent 与 OCR 的原因:底层都是「资源约束下的效率工程」。

「我做过最有代表性的事,是在 8 节点 Xeon 集群上做 Linpack 调优:先手算理论峰值,再做控制变量实验, 通过算子库选型、并行拓扑搜索、分块参数扫描三个维度,把实测性能推到 20.36 TFLOPS、理论峰值的 95.6%。 同时用 HPCG 做访存侧对照,拿到 3.52 倍区间差 —— 这个分析思路与 LLM 推理里 batch size 对 memory-bound / compute-bound 的影响是同一个模型。」 —— 90 秒面试自我介绍

现在正把 HPC 方法论迁移到大规模训练与推理:补 NCCL 集合通信、Megatron-LM / DeepSpeed 并行配置、 Nsight / nsys / DCGM profiling、vLLM / TensorRT-LLM 推理实践;同时用 Agent 定制与离线 OCR 保持对应用层的敏感度。

工作原则:每个数字可溯源、每次优化标注边界、失败也记录 —— 本页所有数据遵循同一准则。

📌 本页面所有 HPC 数据均可溯源至竞赛原始运行记录;本地项目源码不公开,如需 demo / 作品演示请通过邮箱联系。
EMAIL
0603230101@tute.edu.cn
PHONE
177 2007 5523
GITHUB
github.com/QTC-2005
BASE
天津 · 期望天津 / 北京
EDUCATION
天津职业技术师范大学 · 2027 届