Lien copié !

Nouvelle Siri en approche : pourquoi Apple a toujours du mal à rattraper son retard

Apple souhaite exécuter des modèles de classe GPT-4 localement sur votre iPhone. La physique suggère que cela pourrait être impossible sans vous ruiner.

🌐
Traduction automatique

Cet article a été traduit automatiquement depuis l’original en anglais. Lire l’original en anglais

Visualisation thermique d'un processeur iPhone exécutant un LLM local.

Lorsque Tim Cook a annoncé « Apple Intelligence », le discours était simple : la confidentialité. Contrairement à OpenAI ou à Google, qui souhaitent aspirer vos données dans leurs immenses fermes de serveurs, Apple souhaite que l’IA vive sur votre téléphone. Ils veulent que le « Cerveau » reste dans votre poche.

Cela semble noble. Cela semble sécurisé. Mais il y a une raison pour laquelle personne d’autre ne l’a encore fait. Cela n’a rien à voir avec la qualité du code. Il s’agit entièrement de Thermodynamique et de Bande passante mémoire.

Apple ne combat pas Google ; ils combattent la physique.

The Hook : le problème du “jeton”

Comprendre pourquoi Siri est toujours stupide en 2025 nécessite d’examiner la bande passante mémoire. Un LLM n’est qu’un fichier géant de poids (nombres). Un modèle de 7 milliards de paramètres (quantifié int4) a une taille d’environ 4 Go.

Pour générer un seul mot (jeton), le processeur doit lire ce fichier entier de 4 Go des puces RAM dans les unités de calcul. Générer une phrase de 20 mots ? Il doit lire ce fichier de 4 Go 20 fois.

Advertisement

Analyse approfondie : le mur de la mémoire

Il s’agit du « goulot d’étranglement de la bande passante mémoire ».

  • Le problème : Le processeur de votre téléphone est rapide (3 GHz). Mais la mémoire de votre téléphone (LPDDR5X) est une paille lente.
  • Le calcul : Un iPhone 16 Pro a une bande passante mémoire d’environ 50 Go/s.
  • La réalité : Si vous devez déplacer un modèle de 4 Go 20 fois par seconde (pour obtenir une vitesse de lecture humaine), vous avez besoin de 80 Go/s de bande passante juste pour l’IA.

Cela laisse zéro bande passante pour le reste du téléphone. Cela conduit à « UI Jank ». Si l’IA parle, votre défilement bégaie. Le téléphone semble cassé.

L’enveloppe thermique : 5 watts contre 500 watts

Un GPU Nvidia H100 dans un centre de données consomme 700 watts. Il dispose d’un refroidissement liquide massif pour l’empêcher de fondre. Un iPhone a un budget thermique total d’environ 5 Watts. Si la valeur augmente, la batterie se vide en 45 minutes et le boîtier devient trop chaud pour être tenu.

Les ingénieurs d’Apple tentent d’intégrer un algorithme de 700 watts dans une enveloppe de 5 watts. Ils le font grâce à une quantification extrême (rendant le modèle plus stupide pour le rendre plus petit) et au « décodage spéculatif » (devinant 3 mots à l’avance).

Mais la chaleur ne ment pas. Les premiers tests d’iOS 19 montrent qu’une utilisation intensive de l’IA atténue la luminosité de l’écran après 3 minutes. Il s’agit d’une limitation thermique protégeant la batterie.

Historique contextuel : l’avarice de la RAM revient à mordre

Pendant des années, Apple a été avare de RAM. Un iPhone aurait 6 Go tandis qu’un Samsung Galaxy aurait 12 Go. Apple a affirmé : « Le système d’exploitation est efficace ! Il n’a pas besoin de plus de RAM. » Ils avaient raison : pour les applications. Ils avaient tort : pour l’IA.

Advertisement

Parce que le modèle AI doit rester « chaud » (chargé dans la RAM) pour être réactif, ce modèle de 4 Go consomme 50 % de la mémoire du téléphone.

  • Le résultat : Lorsque vous posez une question à Siri, le téléphone doit « tuer » Instagram et Safari pour faire de la place au cerveau de Siri.
  • L’expérience utilisateur : Vous revenez à Safari et la page se recharge.

C’est pourquoi la rumeur dit que l’iPhone 18 passera à 12 Go ou 16 Go de RAM. Ce n’est pas pour les jeux. Il s’agit de maintenir le cerveau de l’IA en vie sans tuer vos autres applications.

Analyse prospective : le compromis « Cloud privé »

Apple sait que les appareils sont en train de perdre la guerre de la qualité. Un modèle de paramètres 3B sur un téléphone ne sera jamais aussi intelligent qu’un modèle de paramètres de 1 To dans le cloud (GPT-4).

C’est pourquoi ils ont créé le Private Cloud Compute (PCC). C’est un aveu de défaite de la physique. Lorsque votre demande est trop difficile pour le téléphone (limites thermiques/mémoire), il la transmet à une batterie de serveurs Apple Silicon. Apple jure que les données sont supprimées instantanément. Les utilisateurs doivent leur faire confiance.

Mais l’avenir n’est pas purement « sur appareil ». C’est hybride.

  • Tiny Brain (téléphone) : Gère « Allumer les lumières », « Lire ce texte », « Régler une minuterie ».
  • Big Brain (Cloud) : Gère « Écrire un e-mail au patron », « Résumer ce PDF », « Générer une image ».

Le résultat

Le nouveau Siri n’a pas de difficulté car les ingénieurs d’Apple ont oublié comment coder. Il est en difficulté car la définition du « calcul » est passée du jour au lendemain de « Burst » (ouverture d’une application) à « Sustained » (génération de jetons). Jusqu’à ce que la chimie de la batterie ou la physique de la mémoire changent, le rêve d’une IA super intelligente et totalement privée dans votre poche restera cela : un rêve.

Nos sources (3)

Advertisement

🦋 Discussion sur Bluesky

Discuter sur Bluesky

Recherche de publications...