Taalas ha rilasciato un chip ASIC che esegue Llama 3.1 8B a 17.000 token al secondo
Taalas ha praticamente inciso i 32 strati di Llama 3.1 in sequenza su un chip: i pesi del modello sono transistor fisici incisi nel silicio.
Dovrebbe essere 10 volte più economico in termini di costi di gestione rispetto ai sistemi di inferenza basati su GPU e 10 volte meno energivoro. Non ci sono DRAM/HBM esterne, ma una piccola quantità di SRAM on-chip.
4 Comments
Suoko@feddit.it · 1 pts · 175d
Sembrano buoni per l'automotive e le telecamere del futuro distopico
pgo@mastodon.uno · 1 pts · 175d
@informapirata @aitech
Se il prodotto si rivelerà reale, popcorn e patatine guardando cosa succede alle megacentrali elettriche, agli immensi datacenter e soprattutto alle prenotazioni dei wafer di silicio fatte dai soliti giganti.
Attendere prego...
game@bologna.one · 1 pts · 175d
@pgo @informapirata @aitech
Nel weekend anche questo, sempre in tema boost di performance che si possono dare a Llama con differenti setup hardware: https://news.ycombinator.com/item?id=47104667
Sono tra l'altro esperimenti "dal basso". Mi fa pensare che ci sia veramente molto spazio di ottimizzazione sul tema energia/velocità, se diventasse quello il focus dei grandi player.
francina1909@mastodon.uno · 1 pts · 175d
sandropisano@mastodon.uno · 1 pts · 175d
francina1909@mastodon.uno · 1 pts · 175d
informapirata@mastodon.uno · 1 pts · 175d
@sandropisano aggiungiamo però che si tratta di una tecnologia poco più che prototipale e non ancora né verificata a dovere, né industrializzata. Ma è sicuramente interessante e potenzialmente "disruptive" per alcuni attori del settore
@francina1909 @game @pgo @aitech
francina1909@mastodon.uno · 1 pts · 175d
sandropisano@mastodon.uno · 1 pts · 175d