拿好小本,记好帐,不要让AI带着自己转圈。累死不偿命。

固定不变长线执行计划
框架从此不再大幅改动,全程顺着一条链路稳步推进,不反复调转方向、不推翻现有进度,每一步都紧扣AI芯片架构、边缘端硬件加速、卷积算子底层本质,同时盘活Docker环境、发挥你Zynq工程经验,最终从固定 Sobel 滤波器,递进掌握通用AI卷积加速器设计。

一、核心总路线(永久固定,全程按此走)

已完成:3×3卷积逻辑仿真
固定行进链路:
卷积内核工程加固 → AXIS流式接口封装仿真 → Vivado硬件架构搭建(缓存/访存墙实战)→ Vitis DMA端侧数据调度 → Docker AI模型联动(权重+量化+结果比对)→ 软硬件全闭环调通 → 进阶脉动阵列通用AI算子拓展

二、整体终极目标

吃透AI硬件4大底层核心能力,完成医疗图像边缘AI加速工程,具备AI芯片卷积引擎、片上缓存架构、端侧数据流调度、模型量化部署的实战功底,从传统图像处理工程师过渡到边缘AI硬件开发方向。

  1. 吃透卷积:Sobel固定核 → AI可训练权重卷积,掌握CNN基础算子硬件实现
  2. 吃透访存墙:LineBuffer/窗口缓存/BRAM复用,理解AI芯片带宽瓶颈
  3. 吃透流式总线:AXIS握手协议,对标商用NPU内部数据交互逻辑
  4. 吃透定点量化:溢出处理、位宽截断,掌握浮点模型转FPGA整型部署原理

三、分阶段固定流程(顺序绝不调换,做完一阶段再下一阶段)

阶段0:当前已完成(基准不动)

  • 交付:3×3 Sobel卷积Verilog模块、两套ModelSim仿真脚本(新建库/清库重编译)
  • 成果:矩阵乘加、滑动窗口、卷积计算逻辑验证无误
  • 对应AI基础:摸透AI最底层MAC乘累加运算本质

阶段1:卷积内核工程化加固(下一步立刻执行)

目标:把固定核模块改成支持AI权重配置、定点溢出防护、参数化通用结构,为后续载入训练权重铺路

  1. 代码改造
    • 图像尺寸、卷积窗口、像素位宽全部参数化
    • 增加乘加运算溢出截断逻辑,对齐AI INT8量化规范
    • 固定卷积核改为可外部载入权重端口,脱离死编码固定核
  2. 仿真验证
    使用sim_clean.do清库重编译,原有测试用例结果保持一致
  3. 阶段收获:理解AI算子定点数值特性、模型量化前置逻辑

阶段2:AXIS接口封装 + 接口时序专项仿真

目标:做成标准AXIS流式IP,吃透AI芯片内部数据流握手逻辑

  1. 编写Wrapper封装层,挂载加固后的卷积内核
  2. 完备实现valid/ready反压、tlast帧结束信号
  3. 搭建数据流Testbench,模拟DMA真实连续图像流
  4. 验收:无丢数、无错位、帧边界识别准确
  5. 阶段收获:掌握商用NPU/DPU通用流式数据交互架构

阶段3:Vivado硬件工程搭建(访存墙实战核心阶段)

依托你的Zynq多年经验快速搭建,重点落地AI缓存瓶颈设计

  1. 块设计搭建:Zynq最小系统 + AXI DMA + 自研卷积IP + 时钟复位互联
  2. 关键设计:片上LineBuffer、窗口缓存BRAM规划,实战解决DDR反复读取带宽问题
  3. 总线连线:MM2S/S2MM通路打通,开启PS-PL高速HP接口
  4. 综合时序收敛,导出XSA文件
  5. 阶段收获:亲身理解AI芯片访存墙瓶颈,掌握片上缓存优化方案

阶段4:Vitis裸机DMA驱动开发(端侧数据搬运)

  1. 基于XSA创建平台与应用工程
  2. 分层编写驱动:DMA自测 → 图像数组加载 → Cache缓存管理、64字节地址对齐
  3. 适配图像数据流传输逻辑,增加传输状态容错
  4. 编译无报错,基础硬件通路正常
  5. 阶段收获:掌握边缘端AI模型、图像大数据板级调度方式

阶段5:Docker环境启用,AI算法侧联动(盘活闲置环境)

PC容器内完成AI配套工作,和FPGA硬件形成对照闭环,不再闲置

  1. 容器内运行PyTorch,搭建同款3×3卷积网络
  2. 任务1:软件卷积计算,和FPGA硬件结果比对,验证算子一致性
  3. 任务2:训练生成AI自定义卷积权重,导出为可载入数组
  4. 任务3:图像预处理、模型浮点转定点量化,适配FPGA位宽
  5. 阶段收获:打通软件AI模型硬件AI算子的链路

阶段6:软硬件全闭环联调

  1. Docker生成的图像+AI权重灌入Zynq DDR
  2. DMA调度数据送入PL卷积加速器完成推理
  3. 处理后数据回传PC,容器内对比软硬件推理误差
  4. 排查花屏、断流、计算偏差问题,工程稳定运行
  5. 最终产出:完整可运行的医疗图像边缘AI加速工程

阶段7:进阶拓展(拔高到AI芯片架构)

基于现有卷积模块,升级学习脉动阵列通用乘加结构,从单一Sobel滤波器,进化为简易通用卷积加速器,对标NPU核心计算阵列设计。

四、各阶段与AI核心能力绑定(每一步都不偏离学习初衷)

开发阶段 对应AI芯片核心知识点
卷积内核加固 AI卷积算子、定点量化、权重可配置原理
AXIS接口仿真 NPU内部流式数据流、总线握手协议
Vivado缓存架构 访存墙瓶颈、BRAM行缓存、带宽优化
DMA驱动开发 边缘端AI数据搬运、DDR内存调度
Docker模型训练 CNN模型生成、权重导出、软硬件精度对标
整机闭环 端侧AI推理完整业务落地

五、当前固定下一步(直接开工,计划不再变动)

现在停留在阶段0完成态,直接切入阶段1:卷积内核工程化加固

  1. 打开systolic_conv_3x3.v源码
  2. 完成参数化改写、溢出防护、权重外置改造
  3. 运行清库仿真脚本验证功能不变
  4. 本阶段全部验收完毕,再进入下一个AXIS封装环节

六、执行约定

  1. 整体阶段框架永久固定,不会再推翻重改、不会切换学习大方向
  2. 仅允许单阶段内细节代码微调、bug修复,不打乱先后执行顺序
  3. 硬件FPGA开发 + Docker AI算法双线并行推进,兼顾工程实操与AI原理
  4. 顺着这条线持续深耕,稳步积累AI芯片架构、边缘加速核心能力,精力不用反复跳转分散
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐