Wanneer een ‘a’ geen ‘a’ is
Hoe IDN en Punycode internationale domeinnamen mogelijk maken – en hoe homograafaanvallen daarvan misbruik maken.
Lees het artikelWat u ziet, is niet altijd wat er wordt opgeslagen. Een letter kan een andere letter zijn, een spatie kan onzichtbaar zijn en een eenvoudig getal kan technisch een benadering blijken.
Voor een gebruiker zijn twee waarden soms overduidelijk gelijk. Een database, programmeertaal of besturingssysteem kan daar heel anders over denken. De oorzaak zit dan bijvoorbeeld in Unicode-codepoints, normalisatie, collatieregels of de manier waarop een getal technisch wordt opgeslagen.
Zulke verschijnselen lijken uitzonderingen, totdat een zoekopdracht een record mist, een join geen overeenkomst oplevert, een sortering onlogisch oogt of een berekening onverwacht afwijkt. In deze reeks onderzoek ik wat er werkelijk wordt opgeslagen en welke afspraken goed datamanagement daarover vraagt.
Hoe IDN en Punycode internationale domeinnamen mogelijk maken – en hoe homograafaanvallen daarvan misbruik maken.
Lees het artikelHoe twee identiek ogende teksten technisch uit verschillende codepoints en bytes kunnen bestaan.
Lees het artikelHoe gewone, niet-afbrekende en onzichtbare spaties sorteringen, koppelingen en controles kunnen ontregelen.
Lees het artikelOver Unicode-casefolding, collaties en de Turkse I: waarom hoofdletters en kleine letters niet in iedere taal volgens dezelfde regels bij elkaar horen.
Over binaire floating-pointgetallen, afrondingsverschillen en de vraag waarom geldbedragen om een bewuste technische representatie vragen.
Wilt u weten waar technische representaties, impliciete regels of inconsistente definities de datakwaliteit binnen uw organisatie beïnvloeden? Met de datamanagement quickscan brengt u sterke punten, risico’s en concrete verbeterkansen in beeld.