Samenvatting
Watermerken in Python kunnen een verborgen 32-bit-ID in tekst plaatsen, zodat kopiëren later detecteerbaar wordt.
Watermerken in Python: wat er gebeurt
Het artikel laat zien hoe je gewone tekst voorziet van een verborgen patroon dat niet als zichtbare stempel verschijnt. Een Python-script van ongeveer 80 regels gebruikt alleen de standaardbibliotheek om een 32-bit-ID in tekst te verwerken en later te detecteren.
De aanpak bestaat uit drie varianten. Onzichtbare tekens zijn eenvoudig toe te voegen, maar verdwijnen bij opschoning of een nieuwe chatbotbewerking. Gecodeerde woordkeuzes overleven lichte redactie, terwijl een volledige herschrijving het patroon verwijdert. Betekenisniveau-markeringen via gerichte sampling zijn lastiger te verwijderen, maar leveren een zwakker signaal op.
Text watermarking: waarom dit belangrijk is
De techniek sluit aan op ontwikkelingen bij AI-bedrijven. Anthropic begon op 2 augustus 2026 met watermerken voor alle tekst uit Claude. Google gebruikt sinds 2024 SynthID-Text voor Gemini en publiceerde de methode later als open source. OpenAI ontwikkelde iets vergelijkbaars. China verplicht sinds september 2025 labels voor door AI gegenereerde content.
Het artikel plaatst die systemen naast oudere voorbeelden uit de uitgevers- en kaartenwereld. Kaartmakers, woordenboekredacteurs en een muziekbedrijf verstopten ooit opzettelijke fouten of variaties om kopieën te herkennen. Het verschil zit nu in de schaal en in de automatische detectie.
De auteur testte de methoden met Gemma-2-9b-it voor het watermerken en Qwen2.5-7B-Instruct voor aanvallen. De proeven omvatten twaalf kanalen, verschillende bewerkingen, volledige parafrases en vertaling naar het Chinees. De dataset bestond uit vijftig originele alinea’s en honderd publiek beschikbare passages voor controles op valse positieven.
Text watermarking: concrete takeaway
Kies de techniek op basis van de bewerking die je verwacht. Gebruik onzichtbare tekens alleen bij gecontroleerde tekststromen; kies woordkeuzes of betekenisniveau-markeringen wanneer lichte redactie of parafrasering onderdeel van het risico vormt. Het project text-watermarking-toolkit bevat scripts, bronmateriaal en kalibratiedata om die keuze zelf te testen.
Verdiep je kennis
Predictive Analytics — Wat kan het voor jouw bedrijf?
Ontdek wat predictive analytics is, hoe het werkt en hoe je het inzet voor je bedrijf. Van de 4 niveaus van analytics to...
KennisbankETL uitgelegd — Extract, Transform, Load in gewone taal
Wat is ETL? Leer hoe Extract, Transform en Load werkt, het verschil met ELT, en welke tools je kunt gebruiken. Helder ui...
KennisbankWat is Power BI? Alles wat je moet weten
Ontdek wat Microsoft Power BI is, hoe het werkt, wat het kost en waarom het de populairste BI-tool ter wereld is. Comple...