Kritikstormen mot Claudes vattenmärkning: ”en förvanskning av skrivandet”

När Anthropic i början av augusti meddelade att Claude skulle börja vattenmärka all genererad text lämnade bolaget en fråga obesvarad: hur märkningen rent tekniskt gick till. Den 14 augusti kom svaret, i en artikel på Anthropics egen sajt. Sedan dess har en debatt brutit ut bland skribenter och teknikbevakare, och den handlar i hög grad om frågor som rör yrkesverksamma författare direkt.

Det som var nytt den 14 augusti

Metoden är en variant av Google DeepMinds SynthID-Text, publicerad i Nature 2024. En språkmodell väljer ett ord i taget bland flera kandidater, och i många lägen är alternativen likvärdiga – Anthropic tar exemplet med en mening om kallt väder, där både ”mulet” och ”grått” fungerar. Normalt avgörs sådana val av ett slumptal. Vid vattenmärkning byts slumpkällan ut mot en hemlig nyckel kombinerad med de närmast föregående orden. Den som har nyckeln kan i efterhand räkna ut hur sannolikt det är att ordsekvensen kommer från Claude.

Anthropic understryker att ingenting läggs till i texten, att inga dolda tecken används och att inga extra tokens förbrukas. Bolaget uppger också att intern testning inte visat någon påverkan på innehåll, kreativitet eller läsbarhet.

Två medgivanden i samma artikel har blivit centrala i kritiken. Programkod får generellt svagare märkning, eftersom koden ofta måste vara exakt och utrymmet för godtyckliga ordval därmed saknas. Detsamma gäller faktatunga passager. Och vid ren korrekturläsning finns ofta för få ändringar för att märket ska fästa.

Invändning ett: kvaliteten

Teknikskribenten John Gruber publicerade den 16 augusti en lång invändning på Daring Fireball under rubriken att märkningen är en förvanskning av skrivandet. Hans grundargument är att inga två synonymer betyder exakt samma sak. Att välja mellan ”mulet” och ”grått” är ett verkligt val, och han vill att modellen gör det utifrån vad som passar texten – inte utifrån en hemlig nyckel. Att något annat än användarens behov styr ordvalet kallar han stötande, och avslutar avsnittet med en obscenitet.

Dagen efter preciserade Gruber argumentet. Språkmodeller väljer redan slumpmässigt bland kandidatorden – parametern kallas temperatur – men den slumpen finns där för att göra texten bättre, eftersom en modell som alltid tar det högst rankade ordet producerar stel och förutsägbar prosa. Vattenmärkningens slump har ett annat syfte. Därför menar Gruber att resultatet oundvikligen blir åtminstone marginellt sämre.

Han vänder också Anthropics eget medgivande om programkod mot bolaget: om exakthet i ordval spelar roll för kod, spelar det roll för prosa. Skillnaden, menar han, är att slarvig kod slutar fungera medan den mänskliga hjärnan är van att tolka oprecis text.

Anthropics försvar vilar på DeepMinds forskning. I Nature-studien serverades en vattenmärkt modell till en del av Geminis trafik, och skillnaden i tummen-upp och tummen-ner var statistiskt obetydlig. En kontrollerad studie där mänskliga bedömare jämförde märkt och omärkt text sida vid sida visade ingen kvalitetsskillnad. Gruber avfärdar tummen-datan som oanvändbar för ändamålet: en läsare klickar inte tummen ner för att modellen valde ”grått” i stället för ”mulet”.

Utvecklaren Daniel Jalkut har publicerat ett genmäle med motsatt slutsats – att märkningen inte kan försämra prosan eftersom temperaturen är oförändrad och endast slumpkällan byts ut. Gruber medger att han kan ha fel, men hävdar att bevisbördan ligger hos bolagen.

Invändning två: hemligheten

Grubers andra invändning gäller även om kvalitetsfrågan skulle falla till Anthropics fördel. Nyckeln som skapar märket är också den nyckel som krävs för att läsa det, och den innehas av leverantören. Claude kan inte upptäcka Geminis märken, och Gemini inte Claudes. En användbar märkning, menar Gruber, vore en som vem som helst kan kontrollera.

Anthropic har aviserat ett detekterings-API men ännu inte släppt det. Fram till dess är det bolaget självt som avgör vad som är märkt.

Invändning tre: fel personer träffas

Utvecklaren James Padolsey, som skrivit en interaktiv genomgång av tekniken, riktar sin kritik mot regelverket och mot Anthropics tolkning av det. Han jämför med räknedosan och rättstavningsprogrammet: ingen kräver att en uträkning märks som maskinellt framtagen. Att göra hjälpmedel misstänkliggjorda först när de blir kapabla nog att formulera en hel mening är enligt honom ingen principiell gränsdragning, utan ett moraliskt pristillägg på svårighet.

Padolsey menar också att Anthropics lösning på modellnivå är bredare än lagens minimikrav. Effekten blir en signal som är tillräckligt bred för att träffa harmlös och hjälpsökande användning, men tillräckligt skör för att avlägsnas av den som verkligen vill.

Han bör veta. Padolsey ligger bakom Declaude, en webbtjänst som skriver om AI-präglad text till neutral prosa och därmed också tar bort märkningen. Forskning pekar åt samma håll: en granskning från Queen’s University i Kanada visar att SynthID-Text tappar detekterbarhet vid parafrasering, klipp-och-klistra-redigering och tillbakaöversättning.

Bloggaren Michael Lopp har beskrivit strategin som fientlig mot skribenter. Skribenten Jeff Gamet har pekat på att märket följer med vid kopiering och inklistring, vilket öppnar för att människoskriven text felaktigt flaggas sedan den korrekturlästs eller citerats ur en märkt källa.

Motargumenten

Kritiken har mött kritik. Dan Moren på Six Colors invänder mot själva premissen: en språkmodell kan inte bry sig om vilket ord den väljer, eftersom den inte kan bry sig om någonting. Modellen har aldrig smakat en ananas och kan därför inte veta vilket ord som är rätt. Moren avslutar med den fråga som träffar hårdast: den som bryr sig så mycket om ordval, varför använder den AI för att generera text? Skulle märkningen göra AI-text sämre ser han det som ett önskvärt utfall.

Gruber svarar att han läser modellernas svar dagligen och vill att de ska vara klara och läsbara, oavsett vem eller vad som skrivit dem.

Skribenten David Gerard har lyft en annan invändning: SynthID har vattenmärkt Geminis text i flera år utan att någon reagerat, och upprördheten kommer först nu när Claude gör detsamma. På Hacker News, där tråden om Grubers text passerade 200 kommentarer, har flera pekat på att han i ursprungstexten framställde modellernas ordval som mer deterministiskt än det är – en invändning Gruber bemötte i sin uppföljning.

Den fråga ingen har ställt än

I slutet av uppföljningen tar Gruber upp en språkfråga som är direkt relevant för svenska förhållanden. Han citerar Jorge Luis Borges, som i en tv-intervju 1977 argumenterade för att engelskan har en ovanlig uttryckskraft eftersom språket har både ett germanskt och ett latinskt register – ”regal” och ”kingly” betyder inte riktigt samma sak.

Kirk McElhearn, tidigare översättare från franska till engelska, har fört resonemanget vidare till Gruber. Franskan saknar ofta motsvarande dubbleringar; både ”he leaped at the chance” och ”he jumped at the opportunity” blir samma mening på franska. McElhearn väcker därmed frågan om engelskan är mer märkbar än andra språk, just därför att den erbjuder fler ungefärliga synonymer att gömma en signal i.

Frågan är obesvarad, och ingen har såvitt känt undersökt hur den faller ut för svenskan – som i likhet med engelskan har ett germanskt arv kompletterat med lågtyska, latinska och franska lån. Den har praktisk betydelse, eftersom Anthropic uppger att översättningar bär full märkning: när modellen översätter väljer den varje ord, och hela texten blir därmed märkbar. En svensk översättare som låter Claude göra ett första utkast lämnar alltså ifrån sig en text där varje ordval härrör från modellen.

Vad det innebär i praktiken

Anthropics egen dokumentation redovisar de begränsningar som är mest relevanta för skribenter:

  • Ett upptäckt märke visar att Claude kan ha bearbetat texten. Det avgör inte författarskap.
  • Korta stycken går inte att bedöma tillförlitligt. Ju längre text, desto säkrare analys.
  • Frånvaro av märke bevisar ingenting: äldre modeller, andra AI-verktyg och kraftigt omarbetad text saknar signal.
  • Lätt redigering tar sannolikt inte bort märket. En fullständig omskrivning gör det.
  • Märkningen bär ingen information som kan knytas till en enskild användare, organisation eller konversation.

Enligt den sammanfattning av regelverket som Gruber återger från Stratechery omfattar kraven text längre än 200 tokens, och leverantörens användarvillkor ska förbjuda användare att avlägsna märkningen. OpenAI har hittills endast uppgett att bolaget avser utvidga ursprungssignaler till samtliga modaliteter inklusive text, utan att precisera omfattning eller geografi.

Källor: