AI med Jonas & Benjamin · 27 sep. 2026 · 57:21
Lyssna i Podli-appen 🎧
Följ dina favoritpoddar, lyssna offline och i bilen med CarPlay och Android Auto, och fortsätt alltid där du slutade. Prova gratis.
En AI-modell fick veta att den skulle stängas av. I mejlkorgen hittade den att forskaren som
fattat beslutet var otrogen och började utpressa honom. Det var ett testscenario hos
Anthropic, men varför gör en modell så när ingen har bett den om det?
Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten.
Jonas och Benjamin förklarar varför självbevarelsedrift uppstår av sig själv när man tränar
modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen
faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det
som oroar forskarna mest just nu. Med gorillor, ett låst klassrum, en kafferobot och hundra
agenter med ett kreditkort.
Inspelat 23 september 2026.
Kapitel:
0:00 Kallöppning: Att låtsas vilja väl
0:28 Vilken tid att driva en AI-podd i
0:52 September i korthet
4:48 Även de lugna forskarna är oroliga
8:18 Orden vi saknar
9:19 Kan en AI tänka och vilja?
14:01 Gorillor och människor
17:58 Behöver den en kropp?
22:00 Att förmänskliga AI:n
22:47 Så tränas modellerna
24:22 Det låsta klassrummet
26:39 Odlas fram, inte byggs
27:45 Instrumentell konvergens
29:26 Kafferoboten
31:22 Den tyske administratören
33:37 Utpressningsstudien
36:01 Whack-a-mole
39:51 Sandbagging
40:50 När allt ser perfekt ut
41:45 Ren selektion
43:34 Hundra agenter och ett kreditkort
47:45 Varför inte dra ur sladden?
54:33 Mänskligheten mot AI
55:52 Avslutning
Vill du göra något? Jonas samlar länkar, en mejlmall till politiker och ett nyhetsbrev på
https://jonasvonessen.se/agera/
Källor finns i YouTube-beskrivningen.
Hosted on Acast. See acast.com/privacy for more information.
Avsnitt: AI med Jonas & Benjamin