Korisnik sa Reddita spojio je iPhone 17 Pro Max sa M4 Pro MacBook Pro putem USB-C porta i uz pomoć prilagođenog softvera postigao do 44% brže prefill brzine pri pokretanju AI modela Qwen3.8-27B.
Kako sistem funkcioniše?
Korisnik pod imenom „u/StayLameBro“ podelio je računarski rad između dva uređaja. MacBook Pro obrađuje slojeve 1 do 40 svakog paketa od 256 tokena i šalje aktivacije telefonu, dok iPhone preuzima slojeve 41 do 64 koristeći GPU čipa A19 Pro. GPU akceleracija čini telefon oko 2,4 puta bržim nego bez nje.
Neural Engine takođe igra ulogu – svaki blok od 16K starog konteksta kompajlira se u Neural Engine model, što smanjuje vreme pisanja po tokenu sa 279ms na 176ms pri kontekstu od 140K.
Rezultati testiranja
– Pri 8K kontekstu: 132 tok/s samo Mac vs. 177 tok/s sa iPhoneom (+35%)
– Pri 16K kontekstu: 109 tok/s vs. 157 tok/s (+44%)
– Pri 32K kontekstu: 101 tok/s vs. 130 tok/s (+29%)
Ograničenja
Ipak, postoje bitna ograničenja. iPhone ne ubrzava generisanje teksta ispod 64K konteksta – to ostaje zadatak MacBook-a. Radi se o eksperimentalnom projektu.
Softver je open-source i dostupan na GitHubu pod nazivom „backburner“.
I made my iPhone a second GPU for my 24 GB MacBook: Qwen 3.8 27B prefills 29–44% faster & my holds part of the CTX window.
byu/StayLameBro inLocalLLaMA
Zanimljivo je da bi budući iPhone 18 Pro sa čipom A20 Pro i dual-16-core Neural Engineom mogao ponuditi još bolje performanse za ovakve zadatke.




