跟着AI走,自己累成狗
拿好小本,记好帐,不要让AI带着自己转圈。累死不偿命。
固定不变长线执行计划
框架从此不再大幅改动,全程顺着一条链路稳步推进,不反复调转方向、不推翻现有进度,每一步都紧扣AI芯片架构、边缘端硬件加速、卷积算子底层本质,同时盘活Docker环境、发挥你Zynq工程经验,最终从固定 Sobel 滤波器,递进掌握通用AI卷积加速器设计。
一、核心总路线(永久固定,全程按此走)
已完成:3×3卷积逻辑仿真
固定行进链路:
卷积内核工程加固 → AXIS流式接口封装仿真 → Vivado硬件架构搭建(缓存/访存墙实战)→ Vitis DMA端侧数据调度 → Docker AI模型联动(权重+量化+结果比对)→ 软硬件全闭环调通 → 进阶脉动阵列通用AI算子拓展
二、整体终极目标
吃透AI硬件4大底层核心能力,完成医疗图像边缘AI加速工程,具备AI芯片卷积引擎、片上缓存架构、端侧数据流调度、模型量化部署的实战功底,从传统图像处理工程师过渡到边缘AI硬件开发方向。
- 吃透卷积:Sobel固定核 → AI可训练权重卷积,掌握CNN基础算子硬件实现
- 吃透访存墙:LineBuffer/窗口缓存/BRAM复用,理解AI芯片带宽瓶颈
- 吃透流式总线:AXIS握手协议,对标商用NPU内部数据交互逻辑
- 吃透定点量化:溢出处理、位宽截断,掌握浮点模型转FPGA整型部署原理
三、分阶段固定流程(顺序绝不调换,做完一阶段再下一阶段)
阶段0:当前已完成(基准不动)
- 交付:3×3 Sobel卷积Verilog模块、两套ModelSim仿真脚本(新建库/清库重编译)
- 成果:矩阵乘加、滑动窗口、卷积计算逻辑验证无误
- 对应AI基础:摸透AI最底层MAC乘累加运算本质
阶段1:卷积内核工程化加固(下一步立刻执行)
目标:把固定核模块改成支持AI权重配置、定点溢出防护、参数化通用结构,为后续载入训练权重铺路
- 代码改造
- 图像尺寸、卷积窗口、像素位宽全部参数化
- 增加乘加运算溢出截断逻辑,对齐AI INT8量化规范
- 固定卷积核改为可外部载入权重端口,脱离死编码固定核
- 仿真验证
使用sim_clean.do清库重编译,原有测试用例结果保持一致 - 阶段收获:理解AI算子定点数值特性、模型量化前置逻辑
阶段2:AXIS接口封装 + 接口时序专项仿真
目标:做成标准AXIS流式IP,吃透AI芯片内部数据流握手逻辑
- 编写Wrapper封装层,挂载加固后的卷积内核
- 完备实现valid/ready反压、tlast帧结束信号
- 搭建数据流Testbench,模拟DMA真实连续图像流
- 验收:无丢数、无错位、帧边界识别准确
- 阶段收获:掌握商用NPU/DPU通用流式数据交互架构
阶段3:Vivado硬件工程搭建(访存墙实战核心阶段)
依托你的Zynq多年经验快速搭建,重点落地AI缓存瓶颈设计
- 块设计搭建:Zynq最小系统 + AXI DMA + 自研卷积IP + 时钟复位互联
- 关键设计:片上LineBuffer、窗口缓存BRAM规划,实战解决DDR反复读取带宽问题
- 总线连线:MM2S/S2MM通路打通,开启PS-PL高速HP接口
- 综合时序收敛,导出XSA文件
- 阶段收获:亲身理解AI芯片访存墙瓶颈,掌握片上缓存优化方案
阶段4:Vitis裸机DMA驱动开发(端侧数据搬运)
- 基于XSA创建平台与应用工程
- 分层编写驱动:DMA自测 → 图像数组加载 → Cache缓存管理、64字节地址对齐
- 适配图像数据流传输逻辑,增加传输状态容错
- 编译无报错,基础硬件通路正常
- 阶段收获:掌握边缘端AI模型、图像大数据板级调度方式
阶段5:Docker环境启用,AI算法侧联动(盘活闲置环境)
PC容器内完成AI配套工作,和FPGA硬件形成对照闭环,不再闲置
- 容器内运行PyTorch,搭建同款3×3卷积网络
- 任务1:软件卷积计算,和FPGA硬件结果比对,验证算子一致性
- 任务2:训练生成AI自定义卷积权重,导出为可载入数组
- 任务3:图像预处理、模型浮点转定点量化,适配FPGA位宽
- 阶段收获:打通软件AI模型到硬件AI算子的链路
阶段6:软硬件全闭环联调
- Docker生成的图像+AI权重灌入Zynq DDR
- DMA调度数据送入PL卷积加速器完成推理
- 处理后数据回传PC,容器内对比软硬件推理误差
- 排查花屏、断流、计算偏差问题,工程稳定运行
- 最终产出:完整可运行的医疗图像边缘AI加速工程
阶段7:进阶拓展(拔高到AI芯片架构)
基于现有卷积模块,升级学习脉动阵列通用乘加结构,从单一Sobel滤波器,进化为简易通用卷积加速器,对标NPU核心计算阵列设计。
四、各阶段与AI核心能力绑定(每一步都不偏离学习初衷)
| 开发阶段 | 对应AI芯片核心知识点 |
|---|---|
| 卷积内核加固 | AI卷积算子、定点量化、权重可配置原理 |
| AXIS接口仿真 | NPU内部流式数据流、总线握手协议 |
| Vivado缓存架构 | 访存墙瓶颈、BRAM行缓存、带宽优化 |
| DMA驱动开发 | 边缘端AI数据搬运、DDR内存调度 |
| Docker模型训练 | CNN模型生成、权重导出、软硬件精度对标 |
| 整机闭环 | 端侧AI推理完整业务落地 |
五、当前固定下一步(直接开工,计划不再变动)
现在停留在阶段0完成态,直接切入阶段1:卷积内核工程化加固
- 打开
systolic_conv_3x3.v源码 - 完成参数化改写、溢出防护、权重外置改造
- 运行清库仿真脚本验证功能不变
- 本阶段全部验收完毕,再进入下一个AXIS封装环节
六、执行约定
- 整体阶段框架永久固定,不会再推翻重改、不会切换学习大方向
- 仅允许单阶段内细节代码微调、bug修复,不打乱先后执行顺序
- 硬件FPGA开发 + Docker AI算法双线并行推进,兼顾工程实操与AI原理
- 顺着这条线持续深耕,稳步积累AI芯片架构、边缘加速核心能力,精力不用反复跳转分散
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)