Le chapitre précédent a assemblé des transistors en portes. Une puce moderne en compte des milliards, et personne ne les place un par un. On les fabrique tous ensemble, couche par couche, en imprimant des motifs sur un disque de silicium — des centaines de puces par disque —, comme on tire une photographie d’un négatif. Ce chapitre suit ce procédé de la matière première au boîtier fini, puis fait le calcul qui décide du prix d’une puce.
Du silicium très pur
Le silicium est le deuxième élément le plus abondant de la croûte terrestre ; on le trouve dans le sable et le quartz sous forme de dioxyde de silicium. En faire un matériau pour puces demande deux étapes de purification :
- Le quartz est réduit par du carbone dans un four électrique pour donner du silicium métallurgique, pur à environ 98–99 % — assez bon pour les alliages d’acier et d’aluminium, bien trop sale pour des puces.
- Ce silicium est transformé en gaz (du trichlorosilane), distillé, puis décomposé à nouveau sur des barreaux de silicium chauffés. On obtient du polysilicium de qualité électronique, en général pur à 99,9999999 % ou mieux — « neuf neufs » —, si bien que moins d’un atome sur un milliard est autre chose que du silicium.
La pureté compte parce que le comportement d’une puce est fixé par des impuretés ajoutées exprès, les dopants, qui rendent certaines régions du silicium de type n ou de type p (Semi-conducteurs et dopage, au niveau de la physique, explique leur rôle). Des atomes parasites ajouteraient des dopants que personne n’a demandés.
Cristaux et tranches
Un transistor a besoin d’un monocristal parfait, où chaque atome est à sa place dans le réseau. On le fait croître par la méthode de Czochralski : le polysilicium est fondu dans un creuset en quartz, on trempe un petit cristal germe dans le bain, puis on le remonte lentement en le faisant tourner, et le silicium se solidifie dessus avec la même orientation cristalline. Le résultat est un lingot cylindrique pouvant atteindre environ deux mètres de long.
Le lingot est découpé à la scie à fil en tranches (wafers), qui sont ensuite polies jusqu’au poli miroir, planes à quelques nanomètres près. Les usines de pointe utilisent des tranches de 300 mm de diamètre et de 0,775 mm d’épaisseur. L’industrie avait prévu de passer au 450 mm dans les années 2010, puis y a renoncé : rééquiper toutes les usines coûtait trop cher pour ce que cela rapportait.
Imprimer avec la lumière : la photolithographie
Une puce est construite sur la tranche en couches : d’abord les transistors, dans le silicium lui-même, puis plus de dix couches de câblage en cuivre au-dessus, séparées par des isolants. Chaque couche est définie par photolithographie, répétée pour chaque motif :
- Enduire la tranche d’une résine photosensible.
- L’exposer : une machine appelée scanner envoie de la lumière ultraviolette à travers un masque (ou réticule), une plaque de quartz portant le motif d’une couche, et un système de lentilles réduit l’image quatre fois sur la tranche. Le scanner se déplace pas à pas sur la tranche et expose un champ à la fois.
- Développer : la résine exposée (ou non exposée, selon son type) se dissout, et le motif reste inscrit dans la résine.
- Traiter les zones découvertes : graver de la matière, implanter des ions dopants ou déposer un nouveau matériau.
- Retirer la résine restante, nettoyer, et passer à la couche suivante.
Une puce de pointe passe par des dizaines de masques et plusieurs centaines d’étapes de fabrication, ce qui prend des mois entre la tranche nue et les puces terminées. Tout se déroule en salle blanche, où l’air contient bien moins de particules que celui d’un bloc opératoire, parce qu’une seule poussière tombée sur une tranche peut ruiner une puce.
DUV et EUV
Le plus petit détail qu’une lentille peut imprimer est à peu près proportionnel à la longueur d’onde de la lumière divisée par l’ouverture numérique de la lentille (la largeur du cône de lumière qu’elle recueille). L’industrie est donc passée à des longueurs d’onde toujours plus courtes :
| Source de lumière | Longueur d’onde | Remarques |
|---|---|---|
| lampes à vapeur de mercure | 436, 365 nm | années 1980–1990 |
| DUV (ultraviolet profond), laser KrF | 248 nm | années 1990 |
| DUV, laser ArF | 193 nm | depuis ~2000 ; les versions « à immersion » placent de l’eau entre la lentille et la tranche pour augmenter l’ouverture numérique |
| EUV (ultraviolet extrême) | 13,5 nm | en production depuis ~2019 |
Avec une lumière de 193 nm, les usines ont imprimé des détails bien plus petits que la longueur d’onde grâce à des astuces comme le multi-patterning : répartir un motif dense sur deux à quatre masques et expositions distincts. Cela fonctionne, mais chaque exposition supplémentaire coûte du temps, de l’argent et du rendement.
La lumière EUV est absorbée par presque tout, y compris l’air et le verre. Un scanner EUV travaille donc sous vide, utilise des miroirs au lieu de lentilles, et produit sa lumière en frappant de minuscules gouttelettes d’étain fondu avec un laser puissant, des dizaines de milliers de fois par seconde, ce qui transforme chaque gouttelette en un plasma incandescent. Une seule entreprise néerlandaise, ASML, fabrique tous les scanners EUV du monde ; chacun coûte bien plus de 100 millions de dollars. La génération suivante, l’EUV High-NA, fait passer l’ouverture numérique de 0,33 à 0,55 pour imprimer des lignes encore plus fines.
Ce que veut dire « 3 nm » : rien de mesurable
Les générations de puces s’appellent des nœuds de gravure (process nodes) et portent le nom d’une longueur : 90 nm, 45 nm, 7 nm, 5 nm, 3 nm. Tanenbaum décrit les générations 45 nm et 32 nm du Core i7 par leur finesse de gravure, « la largeur des fils entre les transistors ». C’était à peu près vrai pendant des décennies : le nom du nœud suivait la longueur de la grille du transistor.
À partir de la fin des années 1990, noms de nœuds et longueurs de grille se sont éloignés, et aujourd’hui ces noms sont de pures étiquettes commerciales. Aucun détail d’une puce « 3 nm » ne mesure 3 nm. La distance entre les grilles de deux transistors voisins, le pas de grille, est encore de plusieurs dizaines de nanomètres, et les fils métalliques les plus serrés sont encore espacés d’une vingtaine de nanomètres. Ce que promet vraiment un nouveau nom de nœud, c’est davantage de transistors par unité de surface, et plus de vitesse ou moins de consommation, que le nœud précédent de la même entreprise. Les nœuds de fabricants différents ne sont pas non plus directement comparables : Intel a rebaptisé son procédé « 10 nm » en « Intel 7 » en 2021, parce qu’il était à peu près aussi dense que les procédés 7 nm de ses concurrents.
La densité progresse désormais aussi en changeant la forme du transistor. Les transistors plans ont cédé la place aux FinFET, où le canal est une ailette verticale entourée par la grille sur trois côtés (le procédé 22 nm d’Intel, annoncé en 2011), puis aux transistors à grille enveloppante (gate-all-around), où la grille entoure sur les quatre côtés des feuillets de silicium horizontaux empilés — d’abord le procédé 3 nm de Samsung, puis le N2 de TSMC et le 18A d’Intel. Mieux contrôler le canal, c’est réduire les fuites, l’ennemi décrit dans le chapitre précédent.
Le rendement : pourquoi les grandes puces coûtent cher
Une tranche terminée est couverte de rectangles identiques, les puces (dies). Certaines ont des défauts : une particule, une rayure, une ligne mal imprimée. Une puce qui a un défaut au mauvais endroit ne fonctionne pas. La proportion de puces bonnes est le rendement (yield), et il dépend fortement de la surface de la puce.
Le modèle le plus simple suppose que les défauts tombent au hasard, avec une densité moyenne D par unité de surface. La probabilité qu’une puce de surface A n’ait aucun défaut est alors donnée par la loi de Poisson :
rendement = e^(−D·A)
Prenons une densité de défauts de 0,1 par cm² (un chiffre plausible pour un procédé mûr ; les vrais chiffres sont jalousement gardés) et une tranche de 300 mm. Le nombre de puces qui y tiennent vaut à peu près π·r²/A, moins les puces incomplètes perdues sur le bord, π·d/√(2A) :
| Surface de la puce | Puces par tranche | Rendement | Puces bonnes |
|---|---|---|---|
| 100 mm² | 640 | 90,5 % | 579 |
| 150 mm² | 416 | 86,1 % | 358 |
| 600 mm² | 90 | 54,9 % | 49 |
Une puce six fois plus grande donne sept fois moins de candidates, et seule la moitié fonctionne : près de 12 fois moins de puces bonnes. Comme la tranche coûte le même prix dans les deux cas, chaque grande puce bonne coûte près de douze fois plus qu’une petite, pour six fois plus de silicium.
Cela corrige une affirmation du livre. À propos de placer deux CPU sur une même puce, Tanenbaum dit que doubler la surface de la puce divise par deux le nombre de puces par tranche, ce qui « double essentiellement le coût unitaire de fabrication ». En tenant compte du rendement, il fait plus que doubler. Dans le tableau, doubler la surface de 100 à 200 mm² ferait tomber le rendement de 90,5 % à 81,9 %, et le coût par puce bonne serait multiplié par environ 2,3.
Il y a aussi un plafond infranchissable. Un scanner expose au plus un champ de 26 × 33 mm, environ 858 mm², donc aucune puce ordinaire ne peut être plus grande. Le livre dit que les grandes puces peuvent atteindre 18 × 18 mm (324 mm²) ; les plus gros GPU actuels dépassent 800 mm², tout contre cette limite.
Les fabricants atténuent le problème du rendement de deux façons. Les conceptions prévoient de la redondance : des rangées de réserve dans les matrices mémoire, qu’on active pour remplacer les rangées défectueuses. Et les puces qui ont un défaut dans une unité sont triées (binning) : cette unité est désactivée et la puce est vendue comme un modèle moins cher. Le M2 Ultra sur lequel ce chapitre a été écrit annonce un GPU à 60 cœurs ; la même puce est aussi vendue avec 76 cœurs GPU. Les fabricants ne disent pas quelles configurations inférieures proviennent de puces partiellement défectueuses, mais désactiver des unités est une façon courante de les vendre.
Test et mise en boîtier
Avant de découper la tranche, une carte à pointes touche les plots de chaque puce et y fait des tests électriques, et les puces mauvaises sont marquées. La tranche est amincie, découpée (sciage, dicing), et les puces bonnes sont mises en boîtier. Le boîtier relie les plots microscopiques de la puce à des connexions assez grandes pour être soudées sur une carte, répartit la chaleur et protège le silicium. Ce que transportent toutes ces connexions — alimentation, horloges, mémoire et E/S — est le sujet du chapitre sur les puces de CPU et leurs broches.
Tanenbaum décrit les boîtiers DIP, PGA et LGA, qui s’enfichent dans des supports. Les DIP ne servent plus que pour des composants simples et des kits d’amateurs. Les processeurs de bureau utilisent des supports LGA — AMD a fait passer ses processeurs de bureau du PGA au LGA en 2022 —, mais la plupart des puces actuelles, dans les téléphones, les portables et les cartes embarquées, sont en boîtier BGA (ball grid array) : une matrice de billes de soudure sous le boîtier, soudée directement sur la carte, sans support. À l’intérieur, la puce elle-même est en général montée en flip-chip : à l’envers, ses plots reliés au boîtier par de minuscules bosses de soudure, au lieu de fins fils de liaison tout autour.
Les chiplets
Le tableau des rendements suggère une idée : au lieu d’une grande puce, en fabriquer plusieurs petites et les relier à l’intérieur du boîtier. Quatre puces de 150 mm² au lieu d’une de 600 mm² donnent 358 pièces bonnes par tranche, de quoi faire 89 ensembles complets, contre 49 grandes puces bonnes — presque deux fois plus de produits par tranche, avant de payer le boîtier plus complexe.
C’est l’approche des chiplets, désormais courante :
- Les processeurs Ryzen et EPYC d’AMD combinent depuis 2019 de petites puces de cœurs CPU avec une puce d’entrées-sorties séparée, qui peut même être fabriquée sur un procédé plus ancien et moins cher.
- Le M2 Ultra est formé de deux puces M2 Max reliées par la connexion UltraFusion d’Apple, un pont de silicium qui transporte des milliers de signaux entre elles. Pour le logiciel, il ressemble à une seule puce de 24 cœurs.
- Les GPU pour l’IA côtoient des piles de mémoire HBM : des puces de DRAM empilées verticalement et reliées par des trous à travers le silicium, placées à côté du processeur sur un interposeur en silicium qui porte des milliers de connexions courtes — le boîtier CoWoS de TSMC en est l’exemple le plus connu.
L’idée n’est pas tout à fait nouvelle. Tanenbaum cite le Pentium Pro de 1995, dont le cache de second niveau était une puce séparée placée « dans la même cavité » du boîtier. Ce qui est nouveau, c’est la densité des connexions, qui permet à plusieurs puces de se comporter presque comme une seule.
Qui sait encore le faire
Une usine de pointe coûte des dizaines de milliards de dollars, et chaque nouveau nœud coûte plus cher à mettre au point que le précédent. Les entreprises qui fabriquaient autrefois leurs propres puces ont quitté la course l’une après l’autre, et l’industrie s’est scindée en deux :
- Les fondeurs fabriquent des puces conçues par d’autres. TSMC, à Taïwan, est de loin le plus grand et fabrique les puces d’Apple, d’AMD, de NVIDIA, de Qualcomm et de bien d’autres — dont le M2 Ultra, sur ce qu’Apple appelle un procédé « 5 nanomètres de deuxième génération ». Samsung est l’autre fondeur à la pointe.
- Intel a longtemps conçu et fabriqué ses propres puces, et propose désormais aussi ses capacités de fabrication à d’autres, comme fondeur.
La plupart des entreprises de puces — Apple, AMD, NVIDIA — sont sans usine (fabless) : elles conçoivent des puces et les font fabriquer par des fondeurs. Et derrière elles toutes se trouve une chaîne d’approvisionnement qui a ses propres goulets d’étranglement, comme les scanners EUV d’ASML.
À retenir
- Le silicium est purifié à environ neuf neufs, transformé en lingots monocristallins par la méthode de Czochralski, puis découpé en tranches de 300 mm.
- Chaque couche d’une puce est définie par photolithographie : résine, exposition à travers un masque, développement, puis gravure, implantation ou dépôt. Les puces de pointe demandent des dizaines de masques et des mois de fabrication.
- Le DUV (193 nm) a besoin du multi-patterning pour les détails actuels ; l’EUV (13,5 nm) les imprime directement, avec des miroirs sous vide, sur des machines que seul ASML fabrique.
- Les noms de nœuds comme « 3 nm » sont des étiquettes commerciales, pas des dimensions — contrairement à la « finesse de gravure » du livre. Les transistors sont passés du plan au FinFET, puis à la grille enveloppante.
- Le rendement chute exponentiellement avec la surface de la puce (e^(−D·A)) : à 0,1 défaut/cm², une puce de 600 mm² donne près de 12 fois moins de puces bonnes qu’une puce de 100 mm². Doubler la surface fait plus que doubler le coût, contrairement à ce que dit le livre.
- Les puces sont testées, découpées et mises en boîtier — surtout en BGA et en flip-chip aujourd’hui —, et de plus en plus combinées en chiplets, comme les deux puces du M2 Ultra.