跳到內容

TFLOPS

  • FLOP:一次 floating-point operation,浮點運算。
  • FLOPS:floating-point operations per second,每秒浮點運算次數。
  • TFLOPS:每秒 10¹² 次浮點運算。

TFLOPS 的最後一個 S 表示「每秒」。常見的 TLOFPS 是字母順序寫反了。

同一顆晶片在 FP32、FP16、BF16 或其他數值精度下,峰值吞吐量可能不同。部分規格還會把 Tensor Core、稀疏運算或特定資料型別的條件算進去。

比較兩個 TFLOPS 數字以前,先確認它們使用相同精度、相同運算類型與相同計算條件。

TOPS 使用較廣的 operation 作為計算單位,AI 硬體規格常用 INT8、INT4 或其他指定精度表示;TFLOPS 則明確計算浮點運算。兩者都在描述理論峰值,但不能直接換算或只比較數字大小。

TFLOPS 提供運算能力的理論上限線索。實際執行 Local AI 時,模型架構、Runtime 的運算核心、批次大小與資料搬移都會影響能使用多少峰值能力。

LLM 也常受到記憶體容量與頻寬限制。TFLOPS 很高的 GPU 若放不下模型,仍無法直接執行;模型放得下時,實際速度則要用相同模型、設定與輸入測量。Mac 的容量與頻寬觀念可參考看懂統一記憶體與記憶體頻寬