flashinfer.fused_moe.ExecutionConfig

class flashinfer.fused_moe.ExecutionConfig(enable_pdl: bool | None = None, tune_max_num_tokens: int = 8192)

Runtime execution parameters.

Parameters:
  • enable_pdl (bool or None) – Persistent device launch. None → auto (True for sm90+).

  • tune_max_num_tokens (int) – Token budget hint for autotuner / CUDA graph capture.

__init__(enable_pdl: bool | None = None, tune_max_num_tokens: int = 8192) None

Methods

__init__([enable_pdl, tune_max_num_tokens])

Attributes

enable_pdl

tune_max_num_tokens