Un compte rendu publié le 9 octobre 2026 fait état de gains de 4 à 12 % avec AMD PerfOpt sur un Lenovo ThinkPad P14s Gen 4 équipé d’un AMD Ryzen 7 PRO 7840U et d’une AMD Radeon 780M. Dans les essais d’IA locale, l’effet le plus visible concernait la baisse de la latence avant le premier jeton généré.
Des gains rapportés sur le Ryzen 7 PRO 7840U
La fourchette de 4 à 12 % porte sur différents benchmarks d’IA exécutés sur cette configuration précise. Elle rassemble plusieurs charges de travail : elle ne correspond pas à un résultat attribué à un modèle ou à un test en particulier.
AMD PerfOpt est une optimisation liée à l’IOMMU, l’unité qui gère les accès des périphériques à la mémoire système. Le mécanisme vise à réduire la latence de ces accès pour des GPU intégrés compatibles.
Lemonade, llama.cpp et les charges testées
Avec Lemonade, les essais couvraient les scénarios code-debug, code-short, code-explain et chat-long-output, sur les backends Vulkan et AMD ROCm. Les modèles cités comprenaient Qwen3-14B-GGUF, Qwen3.5-4B-GGUF, MiniCPM4-8B-GGUF, DeepSeek-Qwen3-8B-GGUF et Qwen3-Coder-Next-GGUF.
L’amélioration la plus notable dans Lemonade concernait le délai avant le premier jeton. Le débit progressait aussi, mais plus modestement. Les essais avec llama.cpp portaient sur la génération Vulkan de 128 tokens et le traitement de prompts de 2 048 tokens, notamment avec gpt-oss-20b-Q8_0, Qwen3.5-9B-Q8_0, GLM-4.7-Flash-IQ4_XS et Llama-3.1-Tulu-3-8B-Q8_0.
Le système de test et le réglage PerfOpt
La comparaison rapportée a été réalisée sur un Lenovo ThinkPad P14s Gen 4 avec un Ryzen 7 PRO 7840U et une Radeon 780M intégrée. Le système tournait sous Ubuntu 26.04 LTS avec une compilation du noyau issue de l’arbre Git IOMMU next. Le compte rendu indique que PerfOpt était le seul réglage modifié pendant les essais.
Le projet d’activation par défaut dans Linux 7.4
Un compte rendu publié le 9 octobre 2026 présentait l’activation par défaut de PerfOpt avec Linux 7.4 comme prévue. Le 28 septembre, l’ingénieur d’AMD Mario Limonciello avait proposé d’activer la fonction pour certains GPU intégrés en mode identité, dans lequel les adresses d’accès mémoire sont mappées à l’identique. Après des remarques sur la conception, il a indiqué qu’il réviserait sa proposition.
La proposition décrit un compromis : réduire la latence DMA, c’est-à-dire celle des transferts directs entre le GPU et la mémoire, en retirant au GPU le confinement des accès DMA assuré par l’IOMMU et en désactivant ATS, PRI, PASID et SVA. Ces éléments relèvent de la mise en œuvre proposée. La discussion du patch AMD en détaille la portée.
Pour retrouver le contexte des essais antérieurs sur d’autres plateformes Ryzen, consultez notre précédent article sur AMD PerfOpt.