UTF-32: differenze tra le versioni

Contenuto cancellato Contenuto aggiunto
Nessun oggetto della modifica
Nessun oggetto della modifica
Riga 2:
'''UTF-32''' ('''U'''nicode '''T'''ransformation '''F'''ormat, '''32''' bit) è una codifica dei caratteri [[Unicode]] in sequenze di numeri a 32-[[Bit (informatica)|bit]]. È conosciuta anche come '''UCS-4''' ([[Universal Character Set]] a 4 byte).
 
A differenza delle altre codifiche unicode[[Unicode]] ([[UTF-8]], [[UTF-16]]) che usano una rappresentazione dei dati a lunghezza variabile, UTF-32 è a lunghezza fissa. Proprio l'uso di 4 [[byte]] per ogni carattere lo porta a non essere molto efficiente sulla gestione dello spazio. Nello specifico, i caratteri al di fuori del ''Basic Multilingual Plane'' sono così rari che per molti testi possono essere considerati come inesistenti (ai fini del calcolo della dimensione), ma questo fatto rende la dimensione del testo codificato in UTF-32 da due a quattro volte più grande rispetto alle altre codifiche.
 
Anche se l'avere un numero fisso di byte per carattere da codificare può sembrare più semplice, questa codifica è usata meno frequentemente delle altre. Facilita la divisione di stringhe, ma non significativamente se confrontata con UTF-8 e UTF-16. Non semplifica il calcolo della lunghezza effettiva della stringa visualizzata se non in limitati casi, perché, anche con [[font]] a larghezza fissa ci possono essere più ''punti di codifica'' per ogni posizione di carattere (i caratteri combinati) o più di un carattere visualizzato per una singola codifica (per esempio negli [[Caratteri CJK|ideogrammi CJK]]). I ''caratteri combinati'' fanno si che gli [[Editor (programma)|editor]] di testo non possano trattare ogni singolo carattere codificato come un singolo carattere che sia possibile editare.