ChatGPT Benchmark
-

Warum zwei API Einstellungen Benchmarkwerte stark verbesserten
OpenAI meldet für GPT-5.6 Sol auf dem ARC-AGI-3-Public-Set einen deutlichen Leistungssprung, nachdem zwei API-Einstellungen aktiviert wurden: Retained Reasoning und Compaction. Der Fall zeigt, dass Benchmarks nicht nur Modelle prüfen, sondern auch die Umgebung, in der ein Agent arbeitet. Übersicht: Was OpenAI gemessen hat Warum der Harness entscheidend war Wie Retained Reasoning und Compaction helfen Was…
