flashinfer.fused_moe.BackendOptions¶
- class flashinfer.fused_moe.BackendOptions(candidates: Tuple[CakeWarpDecodeConfig | TrtllmFp4Config | TrtllmFp8BlockConfig | TrtllmFp8PerTensorConfig | TrtllmBf16Config | TrtllmMxInt4Config | CutlassBf16Config | CuTileBf16Config | CuTileNvfp4Config | CutlassW4A16Config | CutlassNvfp4Config | CutlassFp8PerTensorConfig | CutlassFp8BlockConfig | CutlassMxfp8Mxfp4Config | CutlassMxfp8Config | CutlassW4A8Config | CutlassHummingConfig | CuteDslConfig | B12xNvfp4Config | B12xW4A16Config, ...] = ())¶
Ordered list of backend candidates for dispatch and autotuning.
Each backend config implements
supported(arch), wherearchuses the CUDA compute-capability encoding documented byvalid_for().- __init__(candidates: Tuple[CakeWarpDecodeConfig | TrtllmFp4Config | TrtllmFp8BlockConfig | TrtllmFp8PerTensorConfig | TrtllmBf16Config | TrtllmMxInt4Config | CutlassBf16Config | CuTileBf16Config | CuTileNvfp4Config | CutlassW4A16Config | CutlassNvfp4Config | CutlassFp8PerTensorConfig | CutlassFp8BlockConfig | CutlassMxfp8Mxfp4Config | CutlassMxfp8Config | CutlassW4A8Config | CutlassHummingConfig | CuteDslConfig | B12xNvfp4Config | B12xW4A16Config, ...] = ()) None¶
Methods
__init__([candidates])valid_for(arch)Return candidates whose hardware preconditions are met.
Attributes
candidates