diff --git a/docs/source/concept_guides/quantization.mdx b/docs/source/concept_guides/quantization.mdx index e7d934ba98..688fba5d41 100644 --- a/docs/source/concept_guides/quantization.mdx +++ b/docs/source/concept_guides/quantization.mdx @@ -15,7 +15,7 @@ The basic idea behind quantization is quite easy: going from high-precision repr floating-point) for weights and activations to a lower precision data type. The most common lower precision data types are: -- `float16`, accumulation data type `float16` +- `float16`, accumulation data type `float32` - `bfloat16`, accumulation data type `float32` - `int16`, accumulation data type `int32` - `int8`, accumulation data type `int32`