Sicherheit
-

Wie OpenAI Codex im Alltag sicher betreibt
OpenAI betreibt Codex so, dass ein Coding-Agent im Alltag schnell arbeiten kann, ohne still und leise aus dem Ruder zu laufen. Der Kern ist ein dreiteiliger Sicherheitsaufbau: klare technische Grenzen, explizite Freigaben für riskante Schritte und Telemetrie, die das Warum hinter Aktionen nachvollziehbar macht. Übersicht: Sicherheitsprinzip in einem Satz Sandbox und Freigaben Netzwerkzugriff begrenzen Identität…
-

Verifizierter KI Zugang für Cyberabwehr mit GPT 5.5
OpenAI staffelt Cyber-Funktionen von GPT-5.5 über ein Verifikationsprogramm namens Trusted Access for Cyber. Die Idee, je stärker ein Modell bei sicherheitsnahen Aufgaben helfen kann, desto strenger werden Identitätsprüfung, Kontoschutz und Nutzungsrahmen, damit Verteidiger weniger Reibung haben, Angreifer aber nicht profitieren. Übersicht: Trusted Access kurz erklärt Zugriffsstufen im Vergleich Praxisbeispiel und typische Grenzen Pflichten bei höherem…
-

Advanced Account Security macht ChatGPT und Codex sicherer
Advanced Account Security ist eine optionale Sicherheitsstufe für ChatGPT-Logins, die Kontoübernahmen gezielt erschwert, indem sie Passwörter praktisch aus dem Prozess entfernt und Recovery sowie Sessions deutlich strenger macht. Der Schutz gilt automatisch auch für Codex, wenn es über denselben Login genutzt wird. Der Haken ist gewollt: Wer die Funktion aktiviert, muss die eigenen Wiederherstellungs-Schlüssel sauber…
-

Wie GPT-Modelle auf einmal Goblin-Metaphern lernen konnten
Die auffälligen Goblin- und Gremlin-Metaphern in GPT‑5.x waren kein Zufall, sondern ein Nebenprodukt von Trainings-Anreizen. Ausgerechnet das Training für eine verspielte „Nerdy“-Personality belohnte Kreaturen-Metaphern so stark, dass sich der Sprach-Tick in andere Kontexte „übertrug“ und über mehrere Modellgenerationen sichtbar blieb. Übersicht: Der Goblin-Tick in GPT‑5.x Wie die Spur zur Nerdy-Personality führte Warum ein belohnter Stil-Tick…
-

Wie ChatGPT Gewalt begrenzt und Communities schützt
Laut OpenAI soll ChatGPT über Gewalt sprechen können, etwa zur Einordnung von Nachrichten oder zur Prävention, ohne dabei zu einem Werkzeug für reale Angriffe zu werden. Dafür kombiniert das Unternehmen Verhaltensregeln für das Modell, technische Erkennung von Risiko-Signalen, menschliche Prüfung und klare Konsequenzen bei Verstößen. Übersicht: Wo aus einer Frage echte Planung wird Wie riskante…
-

OpenAI Privacy Filter schützt Texte vor PII
OpenAI Privacy Filter ist laut OpenAI ein offen verfügbares Modell, das personenbezogene Daten in freien Texten erkennt und durch Platzhalter ersetzt, auf Wunsch vollständig lokal. Ziel sind schnelle, kontextsensitive Redaktionsläufe für Training, Indexierung, Logs und Review, ohne dass ungefilterte Inhalte das eigene System verlassen müssen. Übersicht: Warum einfache Mustererkennung in der Praxis scheitert Wie das…
-

OpenAI veröffentlicht Child Safety Blueprint für besseren Kinderschutz
OpenAI hat einen Child Safety Blueprint veröffentlicht, eine Leitlinie dafür, wie Anbieter von KI-Systemen besser gegen KI-gestützte sexuelle Ausbeutung von Kindern vorgehen können. Der Schwerpunkt liegt auf drei Hebeln, aktualisierte Gesetze, präzisere Meldungen und Koordination, sowie Safety-by-Design direkt in KI-Produkten. Die Veröffentlichung ist auf der OpenAI-Seite mit dem Datum 7. April 2026 versehen. Übersicht: Warum…
-

OpenAI Safety Fellowship startet Bewerbung bis 3. Mai
Das OpenAI Safety Fellowship ist laut OpenAI ein befristetes Pilotprogramm für externe Forschende und Praktiker, die konkrete, technisch belastbare Arbeit zu KI-Sicherheit und Alignment liefern wollen. Laufzeit ist vom 14. September 2026 bis 5. Februar 2027, Bewerbungen sind bis 3. Mai 2026 möglich, Rückmeldungen sollen bis 25. Juli 2026 erfolgen. Ziel ist ein substanzielles Ergebnis…
-

Industriepolitik im KI Zeitalter Vorschläge von OpenAI
OpenAI hat am 6. April 2026 ein Ideenpapier zur Industriepolitik im KI Zeitalter veröffentlicht, mit dem Ziel, die Diskussion über eine „people first“ Ausrichtung frühzeitig zu starten. Der Kernpunkt ist nicht ein fertiger Masterplan, sondern ein politischer Baukasten, der demokratisch weiterentwickelt werden soll, bevor KI Fortschritt bestehende Institutionen überrollt. Übersicht: Warum gerade jetzt mehr als…
-

Wie OpenAIs Model Spec Verhalten von KI lenkt
Die Model Spec ist OpenAIs öffentliches Regelwerk dafür, wie sich die eigenen KI-Modelle in Konfliktsituationen verhalten sollen, von harter Sicherheit bis zu frei steuerbarem Stil. Der Kern ist eine Prioritätenordnung für Anweisungen, plus klare Standards, an denen Training, Tests und Updates messbar werden. Übersicht: Warum ein öffentliches Verhaltensregelwerk plötzlich praktisch wird Wie sich Model Spec…
-

Teen Sicherheitsregeln als Prompts für sichere KI Apps
OpenAI stellt neue Jugendschutz Richtlinien bereit, die als sofort nutzbare Prompt Vorlagen formuliert sind. Ziel ist, dass Entwickler diese Policies direkt mit dem offenen Safety Modell gpt-oss-safeguard als Klassifikator einsetzen können, um Teen spezifische Risiken konsistent zu erkennen und abzufedern. Übersicht: Warum Teen Kontext Regeln verschiebt Was an Prompt Policies praktisch neu ist So wird…
-

So schützt OpenAI Sora vor Missbrauch
Stand 23. März 2026 setzt Sora laut OpenAI auf ein Sicherheitsprinzip mit zwei Seiten: Inhalte werden technisch als KI erstellt markiert, und riskante Nutzungen rund um Personen, Jugendkonten und problematische Themen werden durch Regeln, Moderation und Nutzerkontrollen begrenzt. Wer Sora verantwortungsvoll nutzt, arbeitet mit diesen Leitplanken, statt sie zu umgehen. Übersicht: Wie Herkunftssignale Fälschungen entwerten…
-

Japan setzt auf strenge Schutzregeln für Teenager KI
Laut OpenAI Japan wurde am 17. März 2026 ein Japan Teen Safety Blueprint vorgestellt, ein Rahmen, der die Nutzung generativer KI für Jugendliche gezielt absichern soll. Im Kern geht es um bessere Alterserkennung, strengere Unter-18-Regeln, mehr Elternwerkzeuge und ein Design, das Wohlbefinden nicht als Nebenbedingung behandelt. Übersicht: Welche Änderungen Jugendliche in Japan tatsächlich spüren Welche…
-

So werden KI Agenten gegen Prompt Injection robuster
Prompt Injection ist längst kein simples „Ignore all instructions“ mehr, sondern wirkt in der Praxis oft wie Social Engineering, also wie gezielte Manipulation durch scheinbar plausiblen Kontext. Wer KI Agenten absichern will, braucht deshalb nicht nur Erkennung, sondern Systemgrenzen, die den Schaden begrenzen, selbst wenn ein Angriff teilweise durchrutscht. Genau diesen Perspektivwechsel beschreibt das Unternehmen…
-

IH Challenge zeigt wie Modelle Regeln richtig priorisieren
Am 10. März 2026 hat OpenAI mit IH-Challenge ein Trainingsset vorgestellt, das Sprachmodelle konsequenter dazu bringt, Anweisungen nach Vertrauensstufe zu sortieren. Das soll Konfliktfälle sauber lösen, Sicherheitsvorgaben im Systemprompt zuverlässiger durchsetzen und Prompt-Injection über Tool-Ausgaben spürbar erschweren. Übersicht: Warum falsche Prioritäten schnell zur Sicherheitslücke werden Welche Trainingsfallen Hierarchie Verhalten kaputtmachen Wodurch IH-Challenge echte Signale statt…
