IndexQ3 2026Fähigkeits-Tracker
Wie zuverlässig lösen Agenten reale Computeraufgaben?
Zwei Messpunkte aus dem Stanford AI Index 2026 (Benchmark OSWorld, bester Wert 2025 von Claude Opus 4.5). Als Ausgangswert nennt der Bericht rund 12 %, die stärksten Modelle lagen früher zwischen 1 und 12 %. Ab der nächsten Ausgabe ergänzt der Tracker jedes Quartal einen Wert.
Quellen Stanford HAI, AI Index Report 2026, Kapitel Technical Performance