flashinfer.fused_moe.ExecutionConfig¶
- class flashinfer.fused_moe.ExecutionConfig(enable_pdl: bool | None = None, tune_max_num_tokens: int = 8192)¶
Runtime execution parameters.
- Parameters:
enable_pdl (bool or None) – Persistent device launch.
None→ auto (True for sm90+).tune_max_num_tokens (int) – Token budget hint for autotuner / CUDA graph capture.
- __init__(enable_pdl: bool | None = None, tune_max_num_tokens: int = 8192) None¶
Methods
__init__([enable_pdl, tune_max_num_tokens])Attributes
enable_pdltune_max_num_tokens