Pendant des années, l’industrie a cherché à mettre un maximum de transistors sur un die, puis la question a été combien de GPU peut-on mettre dans un rack. Aujourd’hui, l’enjeu est de produire les tokens le plus efficacement possible. C’est le défi auquel s’est attelé Ganesh Venkataramanan, concepteur du premier dual core x86 et des puces Tesla.
Actualités
« Nous visons une crise existentielle des infrastructures IA »