Op 7 oktober 2026 noteerde OpenAI drie ingetrokken wiskundige manuscripten nadat een tekenfout een onderliggend argument ongeldig maakte. De repositorygeschiedenis vermeldt daarnaast bewijsreparaties aan 14 andere manuscripten en bronverwijzings- of versie-updates aan nog eens 13. De verzameling was op 6 oktober aangekondigd met 722 manuscripten; de latere catalogus telt er 719.

OpenAI noteert intrekkingen en andere wijzigingen

De fout zat volgens OpenAI in een argument over het wegvallen van een stabilisatieterm en werkte door in drie manuscripten. OpenAI trok die manuscripten in. De geschiedenis houdt die intrekkingen apart van twee andere categorieën: 14 manuscripten kregen bewijsreparaties en 13 andere werden bijgewerkt met wijzigingen in bronverwijzingen of versies.

OpenAI kondigde de verzameling op 6 oktober aan als wiskundig werk dat grotendeels met een intern, niet-uitgebracht model was geproduceerd. De updates van de volgende dag veranderden het aantal manuscripten in de catalogus, maar niet het vermelde aantal resultaatfamilies.

Van 722 manuscripten naar 719

Bij de lancering telde de catalogus 722 manuscripten, verdeeld over 372 resultaatfamilies. Na de drie intrekkingen vermeldde de latere catalogus 719 manuscripten, nog altijd in 372 families.

Een resultaatfamilie kan verwante stukken bij elkaar brengen, zoals een hoofdresultaat met aanvullende argumenten, gevolgtrekkingen of alternatieve bewijzen. Het aantal manuscripten is daarom niet hetzelfde als het aantal afzonderlijke problemen. OpenAI meldde dat het interne model ongeveer 4.000 problemen kreeg voorgelegd; de vrijgegeven catalogus ordent manuscripten rond verwante resultaten.

Wat de Lean-telling zegt

OpenAI meldde dat 300 van de 719 hoofdresultaten in Lean zijn geformaliseerd, circa 42%. Lean is een proof assistant: software die controleert of een formeel uitgeschreven bewijs volgt uit de ingevoerde definities en aannames.

Die 300 is een telling van geformaliseerde resultaten. Onafhankelijke wiskundige beoordeling is een afzonderlijke stap. OpenAI beschrijft de resultaten in de verzameling als werk in verschillende verificatiefasen.

De beoordeling van de resultaten

OpenAI waarschuwt dat sommige niet-geformaliseerde resultaten fouten kunnen bevatten. De repositorygeschiedenis laat bovendien zien dat de verzameling na publicatie is gewijzigd: drie manuscripten zijn ingetrokken, terwijl andere zijn gerepareerd of bijgewerkt.

De bredere discussie over de beoordeling en presentatie van AI-wiskunde kwam ook aan bod in onze eerdere berichtgeving over een OpenAI-wiskundeclaim.