Deze podcast-aflevering belicht de cruciale rol van werkgeheugen (RAM) in het huidige AI-tijdperk en verkent de manier waarop Apple de grens trekt tussen lokale inferentie en de cloud.
- RAM als Flessenhals: Verwerkingssnelheid (CPU/GPU) is niet langer de doorslaggevende factor voor on-device AI; de hoeveelheid werkgeheugen is dat wel. Grote taalmodellen vereisen dat miljarden parameters gelijktijdig in het RAM geladen blijven. Zonder minimaal 12 GB RAM ontstaat een merkbare vertraging door het voortdurend wisselen van data met de harde schijf.
- Apple’s Triagesysteem: Apple introduceert in iOS 27 en macOS Golden Gate een hybride inferiemodel met drie lagen:
- Lokaal op het apparaat: Lichte taken draaien direct via de Neural Engine en het lokale model (3 miljard parameters op 2-bitRestricte quantisatie).
- Private Cloud Compute (PCC): Zwaardere verzoeken worden doorgestuurd naar Apple's eigen beveiligde cloudomgeving.
- Derde partijen: Integraties zoals ChatGPT of Gemini voor de meest complexe taken.
- Hardware-innovaties & M5-chip: De M5-chip bevat Neural Accelerators in elke GPU-kern en maakt gebruik van de Metal Quantum Tensor API. Samen met technieken zoals Quantization Aware Training (2-bit quantisatie) wordt de leessnelheid van context tot 6,4 keer versneld vergeleken met traditionele methoden.
- Privacy en Compliance:
- Local Retrieval (RAG): De eerste dagen na een update herindexeert het apparaat alle bestanden, mails en berichten lokaal, wat tijdelijk voor een hoge piekbelasting en batterijverbruik zorgt.
- Veiligheid op de Apple Watch: Horloges uit de S11- en Ultra 4-serie gebruiken een geïsoleerde Secure Enclave om spraakversleuteling lokaal naar de iPhone door te sturen.
- Zakelijke Risico's: Het gebrek aan een officiële Business Associate Agreement (BAA) bij Apple's PCC brengt strikte privacywetgevingen (zoals AVG of HIPAA) in gevaar voor professionals in de medische of juridische sector.
- Alternatieven voor Offline AI: Gebruikers die volledige privacy eisen, kunnen uitwijken naar offline open-source oplossingen zoals Ollama of LM Studio. Via technieken zoals Smart Reduction worden persoonsgegevens (PII) eerst lokaal gestript voordat een prompt naar een externe cloud wordt verzonden. Via de Activiteitenweergave of netwerk-firewalls (zoals Lulu of Little Snitch) kan worden gecontroleerd dat er geen data weglekt.
De aflevering sluit af met de vraag of Apple's hybride cloudbenadering slechts een tijdelijke tussenoplossing is totdat alle AI-modellen compact genoeg zijn om volledig lokaal te draaien.