flashinfer.fused_moe.BackendOptions

class flashinfer.fused_moe.BackendOptions(candidates: Tuple[CakeWarpDecodeConfig | TrtllmFp4Config | TrtllmFp8BlockConfig | TrtllmFp8PerTensorConfig | TrtllmBf16Config | TrtllmMxInt4Config | CutlassBf16Config | CuTileBf16Config | CuTileNvfp4Config | CutlassW4A16Config | CutlassNvfp4Config | CutlassFp8PerTensorConfig | CutlassFp8BlockConfig | CutlassMxfp8Mxfp4Config | CutlassMxfp8Config | CutlassW4A8Config | CutlassHummingConfig | CuteDslConfig | B12xNvfp4Config | B12xW4A16Config, ...] = ())

Ordered list of backend candidates for dispatch and autotuning.

Each backend config implements supported(arch), where arch uses the CUDA compute-capability encoding documented by valid_for().

__init__(candidates: Tuple[CakeWarpDecodeConfig | TrtllmFp4Config | TrtllmFp8BlockConfig | TrtllmFp8PerTensorConfig | TrtllmBf16Config | TrtllmMxInt4Config | CutlassBf16Config | CuTileBf16Config | CuTileNvfp4Config | CutlassW4A16Config | CutlassNvfp4Config | CutlassFp8PerTensorConfig | CutlassFp8BlockConfig | CutlassMxfp8Mxfp4Config | CutlassMxfp8Config | CutlassW4A8Config | CutlassHummingConfig | CuteDslConfig | B12xNvfp4Config | B12xW4A16Config, ...] = ()) None

Methods

__init__([candidates])

valid_for(arch)

Return candidates whose hardware preconditions are met.

Attributes

candidates