Citat:
Ursprungligen postat av In-Fredel
Följande har jag funderat på ett tag. Hur kan det komma sig att vissa bokstäver (här menar jag grafem) har diakritiska tecken av olika slag medan andra aldrig har det? Jag har gjort en sammanställning av de diakritförsedda bokstäverna med hjälp av Windowsprogrammet ...
(för att se tecknen tydligare, kopiera in detta i t.ex. ett Worddokument och öka teckenstorleken) ...
Det finns ytterligare ett skäl att analysera detta via Word. Om man målar ett mystiskt grafem och gör Infoga/Symbol i Word så får man Unicode-namnet och 16-bitars-koden. Ta till exempel det maltesiska H:et (Ħ) med namnet "latin capital letter H with stroke" och Ư med namnet "latin capital U with horn".¹ Unicode har också tecknet "latin capital U with hook" men Word tycks blanda ihop dom två senare. (Min Word-version är snart ett decennium gammal.) I tveksamma fall gäller Unicode.
Har In-Fredel surfat i Unicode-standarden som är världens state-of-the-art vad gäller grafem? Frågan om snedfördelning kan komma i ett annat ljus om man lämnar Microsofts horisont.
http://www.unicode.org/charts/ (skriv in 0187 resp 01AF exempelvis)
http://en.wikipedia.org/wiki/Maltese_alphabet
Det är en uttalad policy av Unicode att grafem inte skall vara explicit bundna till ett visst språk. Tyska, ungerska, turkiska och svenska ö/Ö är samma grafem. Detta har hittills visat sig vara ett bra beslut av Unicode. Samtidigt finns det en stark korrelation mellan kodsidor och språk som arabiska. Runorna på 16A0 ff är väl ett gränsfall.
I praktiken har förstås enskilda länder tagit initiativ för att få sina språk stödda vad gäller grafem i operativsystem och ordbehandlare. ISO hade ett parallellprojekt till Unicode, och den konvergerade med Unicode. I slutremissen lämnade ISO över till Unicode-consortiet. IPA stöds av Unicode men implementationerna förefaller ojämna i exempelvis Windows och Word (i 2003 års upplagor).
Ref.
http://en.wikipedia.org/wiki/ISO_10646
Då och då påminner jag om att Island gjorde ett tappert jobb med att få utökningen av 7-bits ASCII till 8-bits ISO Latin1 att täcka þÞðÐ. Fransmännen »glömde« äska utrymme där för ligaturen œŒ i 8-bitskoden. Att spida förklaringen skulle bara spä på fördomarna mot grodätare och deras eftermiddagsvanor. Så småningom fixade Microsoft in œŒ‰ och ett par tjeckiska grafem i en gråzon.
I själva verket gjordes det viktiga arbetet med 8-bits ISO Latin 1 av företaget Digital Equipment Corporation, som hade duktiga tekniker men otillräcklig kommersiell drivkraft. Xerox och Apple gjorde fina jobb på vägen mot Unicode. Det stora blå bolaget har skämt ut sig genom att släpa på gammalt skräp som "national code pages" in i dessa dagar.
¹ Annars är frasen "horny U" företrädesvis avsett för användning i dualis inom familjen.