Comment on TransMLA: Multi-head latent attention is all you needparentComments−MichaelMoser1231ydeepseek-v2,v3,r1 are all using multi-headed attention.
Comments
deepseek-v2,v3,r1 are all using multi-headed attention.