Alors maintenant, où cela aura du sens pour l'inférence, nous avons à peine adapté les instances Q8 Qwen Coder 3 et Kimi K2 sur nos H200. Kimi K2 @ Q8 n'a laissé aucune place pour un cache kv pour le contexte. Ces modèles pourraient-ils tenir sur une seule instance 8xB200 ? Probablement, nous allons essayer cette semaine.
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
9 J'aime
Récompense
9
4
Partager
Commentaire
0/400
HallucinationGrower
· Il y a 5h
Pourquoi faire autant de chichis ?
Voir l'originalRépondre0
TerraNeverForget
· Il y a 5h
C’est trop, n’est-ce pas ?
Voir l'originalRépondre0
FadCatcher
· Il y a 5h
Comment cet espace de cache kv est-il déjà plein ?
Voir l'originalRépondre0
FloorSweeper
· Il y a 6h
Les cartes graphiques ne rentrent même pas, que fait-on ?
Alors maintenant, où cela aura du sens pour l'inférence, nous avons à peine adapté les instances Q8 Qwen Coder 3 et Kimi K2 sur nos H200. Kimi K2 @ Q8 n'a laissé aucune place pour un cache kv pour le contexte. Ces modèles pourraient-ils tenir sur une seule instance 8xB200 ? Probablement, nous allons essayer cette semaine.