CUDA: fix Gemma 2 numerical issues for FA (ggml-org#9166)

JohannesGaessler · web-flow · commit f91fc5639be1 · 2024-08-25T22:11:48.000+02:00
diff --git a/src/llama.cpp b/src/llama.cpp
@@ -8877,7 +8877,7 @@ static struct ggml_tensor * llm_build_kqv(
         cur = ggml_flash_attn_ext(ctx, q, k, v, kq_mask, kq_scale, hparams.f_max_alibi_bias,
                                   hparams.attn_soft_cap ? hparams.f_attn_logit_softcapping : 0.0f);
 
-        if (model.arch == LLM_ARCH_PHI2 || model.arch == LLM_ARCH_PHI3 || model.arch == LLM_ARCH_GPTNEOX) {
+        if (model.arch == LLM_ARCH_PHI2 || model.arch == LLM_ARCH_PHI3 || model.arch == LLM_ARCH_GPTNEOX || model.arch == LLM_ARCH_GEMMA2) {
             ggml_flash_attn_ext_set_prec(cur, GGML_PREC_F32);
         }
 

Original file line number	Diff line number	Diff line change
`@@ -8877,7 +8877,7 @@ static struct ggml_tensor * llm_build_kqv(`
`8877`	`8877`	`cur = ggml_flash_attn_ext(ctx, q, k, v, kq_mask, kq_scale, hparams.f_max_alibi_bias,`
`8878`	`8878`	`hparams.attn_soft_cap ? hparams.f_attn_logit_softcapping : 0.0f);`
`8879`	`8879`
`8880`		`- if (model.arch == LLM_ARCH_PHI2 \|\| model.arch == LLM_ARCH_PHI3 \|\| model.arch == LLM_ARCH_GPTNEOX) {`
	`8880`	`+ if (model.arch == LLM_ARCH_PHI2 \|\| model.arch == LLM_ARCH_PHI3 \|\| model.arch == LLM_ARCH_GPTNEOX \|\| model.arch == LLM_ARCH_GEMMA2) {`
`8881`	`8881`	`ggml_flash_attn_ext_set_prec(cur, GGML_PREC_F32);`
`8882`	`8882`	`}`
`8883`	`8883`