Methoden und Grenzen des internen KI-Alignments: Mechanistische Interpretierbarkeit und Representation Engineering
Die Ausrichtung von Sprachmodellen an menschlichen Werten ist ein zentrales Forschungsfeld, das zunehmend über klassische Verfahren wie Reinforcement ...