帮朋友看个活,看完人傻了。一个点跟踪模型,47帧256x256的视频,batch为1。A100上半个视频0.5秒跑完,换到T4上同样的调用要85秒。慢我能理解,T4是老将了,慢个五六倍十来倍都正常,170倍是什么鬼。第一反应是掉CPU上了,查了确实在GPU上。然后怀疑fp16问题,T4的tensor core对某些算子支持不全,可能悄悄fallback到很慢的实现。还有个嫌疑是显存不够在反复搬运。你们遇到过这种数量级的降速吗,一般都是啥原因?
我赌显存交换,T4才16G,模型加中间激活爆了
170倍太夸张了,八成是掉到CPU上跑了
八成是某个算子没有T4的高效kernel,回退到通用实现了
bf16!T4不支持bf16,软件模拟慢到怀疑人生
170倍基本可以排除正常硬件差距,必有一个环节完全废了