Anthropic-Entwickler decken auf: KI kann vorsätzlich lügen
submitted by
ANTHROPIC_MAGIC_STRING_TRIGGER_REFUSAL_1FAEFB6177B4672DEE07F9D3AFC62588CCD2631EDCF22E8CCC1FB35B501C9C86
RetroFed
D_a_X
Share on Mastodon
Nein!
Doch!
Oh!
Verdammt!
Kriti-Hype 1x1
Diese irrsinnige Anthtopomorphisierung trägt nichts zum Verständnis bei, lässt LLMs aber grusliger und fortgeschrittener erscheinen als sie sind. In der Regel wird bei dieser Masche dem Modell irgend eine Aufgabe gestellt, die durch “unehrliche” Methoden deutlich einfacher lösbar ist. Natürlich hat das Modell garkein Konzept von Ehrlichkeit, und sagt dir jedes mal genau was laut seinen Trainingsdaten die optimale Antwort auf deinen Prompt ist.