
pyasc 性能调优入门用 metrics_prof_start / metrics_prof_stop 精确圈定 msProf 数据采集代码段【免费下载链接】pyasc本项目为Python用户提供算子编程接口支持在昇腾AI处理器上加速计算接口与Ascend C一一对应并遵守Python原生语法。项目地址: https://gitcode.com/cann/pyasc本文围绕asc.language.basic.metrics_prof_start()API 展开讲解它如何与asc.metrics_prof_stop()配合在使用 msProf 工具对昇腾 AI 处理器上的算子进行上板调优时精确指定需要采集性能数据的 kernel 代码段。读完后你将掌握该 API 的调用方式与约束、其从 Python 调用到 Ascend C 代码生成的底层链路以及它与 msprof op 上板/仿真采集流程的配合方法。API 概览metrics_prof_start用于设置性能数据采集信号启动必须与 asc.metrics_prof_stop() 配对使用。使用 msProf 工具进行算子上板调优时可在 kernel 侧目标代码段的前后分别调用asc.metrics_prof_start()和asc.metrics_prof_stop()从而指定需要调优的代码段范围。接口签名与官方文档定义如下见 API 参考页asc.language.basic.metrics_prof_start() - None对应的 Ascend C 函数原型为__aicore__ inline void MetricsProfStart()项目说明参数说明无返回值说明无返回None对应 Ascend C 函数__aicore__ inline void MetricsProfStart()配套 APIasc.metrics_prof_stop()对应__aicore__ inline void MetricsProfStop()最简调用示例asc.metrics_prof_start()由于它与asc.metrics_prof_stop()语义上是同生共死的信号对下面的实现分析和实战示例将两者一并讲解。实战用法圈定 kernel 中的调优代码段这两个 API 是纯 kernel 侧信号函数它们本身不产生任何计算或输出唯一作用是在生成的 Ascend C kernel 代码中插入采集起点/终点标记。典型用法是包裹住你希望 msProf 重点剖析的循环体或计算段import asc asc.jit def vadd_kernel(x: asc.GlobalAddress, y: asc.GlobalAddress, z: asc.GlobalAddress, block_length: int): # ... 张量准备、Local Memory 分配等初始化代码 ... for i in range(TILE_NUM * BUFFER_NUM): buf_id i % BUFFER_NUM # 数据采集区间起点 asc.metrics_prof_start() asc.data_copy(x_local[buf_id * tile_length:], x_gm[i * tile_length:], tile_length) asc.set_flag(asc.HardEvent.MTE2_V, buf_id) asc.wait_flag(asc.HardEvent.MTE2_V, buf_id) asc.add(z_local[buf_id * tile_length:], x_local[buf_id * tile_length:], y_local[buf_id * tile_length:], tile_length) # 数据采集区间终点 asc.metrics_prof_stop()上例结构参考自仓库中最基础的向量加法算子 examples/01_add/add.py——该示例展示了asc.jitkernel 中data_copy/set_flag/wait_flag/add的完整流水写法。将metrics_prof_start/metrics_prof_stop插入主循环前后即可让 msProf 的指标聚焦到核心计算迭代上而不是被初始化、数据搬运等外围代码稀释。采集到数据后即可按 算子调试调优指南 的流程导出分析产物。上板场景参考命令msprof op --output./output python add_framework.py -r NPU成功执行后在 output 目录下生成ArithmeticUtilization.csv、Memory.csv、MemoryL0.csv、MemoryUB.csv、PipeUtilization.csv、ResourceConflictRatio.csv、visualize_data.bin等文件将visualize_data.bin导入 MindStudio Insight 后可查看计算内存热力图、Roofline 瓶颈分析图、Cache 热力图、通算流水图和算子代码热点图。仿真场景则使用msprof op simulator --output./output python add_framework.py -r Model -v Ascend910B1各核的code_exe.csv、instr_exe.csv与trace.json分别用于指令流水图、算子代码热点图和内存通路吞吐率波形图分析。源码实现从 Python 调用到 IR 操作metrics_prof_start和metrics_prof_stop定义在 python/asc/language/basic/dump_tensor.py该文件同时承载printf、print_time_stamp、dump_tensor等 kernel 侧调试 APIoverload def metrics_prof_start() - None: ... require_jit set_common_docstring(api_namemetrics_prof_start) def metrics_prof_start() - None: builder global_builder.get_ir_builder() builder.create_asc_MetricsProfStartOp() require_jit set_common_docstring(api_namemetrics_prof_stop) def metrics_prof_stop() - None: builder global_builder.get_ir_builder() builder.create_asc_MetricsProfStopOp()实现上有两个关键点require_jit装饰器表明该 API 只能在asc.jit装饰的 kernel 函数体内调用。它不会在 host 端执行任何采集逻辑而是在 JIT 编译阶段向当前构建上下文global_builder.get_ir_builder()插入一个 IR 操作节点。零参数、零返回值与文档声明一致函数体只执行一次create_asc_MetricsProfStartOp()/create_asc_MetricsProfStopOp()不携带任何张量、标量参数。这两个 IR 操作在 TableGen 中定义于 include/ascir/Dialect/Asc/IR/Basic/OpDumpTensor.tddef AscendC_MetricsProfStartOp : APIOpmetrics_prof_start,MetricsProfStart, [AscFunc] { let description Start performance metrics collection for a code region; pair with MetricsProfStop.; let assemblyFormat attr-dict; } def AscendC_MetricsProfStopOp : APIOpmetrics_prof_stop,MetricsProfStop, [AscFunc] { let description Stop performance metrics collection started by MetricsProfStart.; let assemblyFormat attr-dict; }从定义可见两点事实操作属于AscendC方言下的APIOp携带AscFunc属性即映射到 Ascend C 库函数MetricsProfStart/MetricsProfStoparguments为空、assemblyFormat attr-dict与 Python 侧无参数的签名严格对应。官方文档中对应 Ascend C 函数原型为__aicore__ inline void MetricsProfStart()的说明正是这一映射关系在文档层的体现。在导出层面两个函数通过 python/asc/language/basic/dump_tensor.py 被导入 python/asc/language/init.py 并挂在asc包顶层命名空间因此在 kernel 中可以直接写asc.metrics_prof_start()而不必从子模块导入。代码生成验证IR 到 Ascend C 的落点仓库自带 lit 测试对IR 操作 → Ascend C 源码的落点做了精确断言。test/Target/AscendC/basic/dump_tensor.mlir 中// CHECK-LABEL:void emit_metrics_prof_start() { // CHECK-NEXT: AscendC::MetricsProfStart(); // CHECK-NEXT: return; // CHECK-NEXT: } func.func emit_metrics_prof_start() { ascendc.metrics_prof_start return } // CHECK-LABEL:void emit_metrics_prof_stop() { // CHECK-NEXT: AscendC::MetricsProfStop(); // CHECK-NEXT: return; // CHECK-NEXT: } func.func emit_metrics_prof_stop() { ascendc.metrics_prof_stop return }即ascendc.metrics_prof_start这个 IR 操作最终会发射为 Ascend C kernel 源码中的一行AscendC::MetricsProfStart();metrics_prof_stop同理发射为AscendC::MetricsProfStop();。这意味着你在 Python kernel 里写的两个 API 调用最终以无参数函数调用的形式出现在生成的 Ascend C 代码中与手写 Ascend C 算子里直接调用这两个函数完全等价msProf 工具按 Ascend C 约定识别该标记进行区间采集。使用约束与注意事项结合源码实现与文档表述使用这两个 API 时需注意只可在asc.jitkernel 内调用require_jit装饰器决定了调用上下文在 host 端普通 Python 函数中调用不会生效于算子执行。成对使用metrics_prof_start设置采集信号启动metrics_prof_stop设置停止信号二者必须成对出现才能划定完整代码段范围单独调用一个标记不会形成有效采集区间。面向调测阶段与同文件的printf、dump_tensor等调试 API 一样性能数据采集与调试输出通常用于开发和调测阶段用于定位软硬件瓶颈该结论参考 docs/op_debug_prof.md 中对调试接口的约束说明。需要配合 msProf 工具链API 本身只在 kernel 中打点指标导出依赖msprof op/msprof op simulator采集命令环境准备可参考 docs/quick_start.md 的相应章节。小结asc.metrics_prof_start()/asc.metrics_prof_stop()是 pyasc 提供的 kernel 侧性能打点 API无参数、无返回值经require_jit在 JIT 阶段生成ascendc.metrics_prof_start/ascendc.metrics_prof_stopIR 操作最终发射为 Ascend C 的AscendC::MetricsProfStart()/AscendC::MetricsProfStop()调用。将它们包裹在需要调优的代码段前后再结合msprof op上板或msprof op simulator仿真采集即可获得聚焦目标区间的性能指标与可视化数据是 pyasc 算子性能调优流程中的起点工具。相关 API 文档、实现源码与测试分别位于 docs/python-api/language/generated/asc.language.basic.metrics_prof_start.md、python/asc/language/basic/dump_tensor.py 和 test/Target/AscendC/basic/dump_tensor.mlir可进一步深入阅读。【免费下载链接】pyasc本项目为Python用户提供算子编程接口支持在昇腾AI处理器上加速计算接口与Ascend C一一对应并遵守Python原生语法。项目地址: https://gitcode.com/cann/pyasc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考