Un chercheur d'OpenAI salue la solution d'inférence AI conjointe entre AMD et Cerebras, estimant une amélioration de 5 fois de la performance par watt
7x24h Brève
Un chercheur d'OpenAI salue la solution d'inférence AI conjointe entre AMD et Cerebras, estimant une amélioration de 5 fois de la performance par watt
Le chercheur d'OpenAI Jeffrey Wang a qualifié de « incroyable » la performance de la solution d'inférence IA développée conjointement par AMD et Cerebras. Cette solution intègre les baies AMD Helios et les moteurs wafer-scale de Cerebras, traitant respectivement les prompts et la génération de tokens, et devrait multiplier par 5 le nombre de tokens par seconde par watt. Cette approche technique optimise les performances d'inférence grâce au calcul hétérogène, reflétant l'attention soutenue des principaux laboratoires d'IA sur la réduction des coûts d'inférence.
Selon TechFlow, le 29 juillet, le chercheur d'OpenAI Jeffrey Wang a qualifié de « incroyable » la performance de la solution d'inférence IA développée conjointement par AMD et Cerebras. Cette solution intègre le rack AMD Helios et le moteur à l'échelle du wafer de Cerebras, traitant respectivement les étapes de prompt et de génération de tokens, et devrait augmenter le nombre de tokens par seconde par watt de 5 fois. Cette approche technique optimise les performances d'inférence via le calcul hétérogène, reflétant l'attention continue des principaux laboratoires d'IA sur la réduction des coûts d'inférence.




