UTF-32

UTF-32 ist eine Methode zur Kodierung von Unicode-Zeichen, bei der jedes Zeichen mit vier Byte (32 Bit) kodiert wird. Sie kann deshalb als die einfachste Kodierung bezeichnet werden, da alle anderen UTF-Kodierungen variable Bytelängen benutzen. Im Unicode Standard ist UTF-32 eine Untermenge von UCS-4.

Byte Order

Wie auch bei UTF-16 gibt es auch bei UTF-32 zwei Möglichkeiten, die Daten in einem byte-orientierten Datenstrom zu übertragen: Big Endian und Little Endian. Hierfür wurden die Bezeichnungen UTF-32BE und UTF-32LE definiert. UTF-32 wird jedoch – im Gegensatz zu UTF-16 – kaum in Speicher-, Datei- oder Datenaustauschformaten verwendet; und bei rein programm-interner Verwendung werden die Daten normalerweise stets in der Byte-Reihenfolge verarbeitet, wie sie von der CPU-Architektur vorgegeben sind.

Vorteile

UTF-32 zeigt seine Vorteile bei einigen Sprachen beim wahlfreien Zugriff auf einen bestimmten Zahlenwert eines Zeichens im Coderaum (Codepoint), da dessen Adresse durch die Zeigerarithmetik konstanter Zeit berechnet werden kann. Es ist auch möglich, anhand der Größe eines Dokuments in Bytes umgehend die Anzahl der enthaltenen Codepoints auszurechnen (nämlich durch eine simple Division durch 4).

Nachteile

Ein Nachteil von UTF-32 ist der hohe Speicherbedarf. Bei Texten, die überwiegend aus lateinischen Buchstaben bestehen, wird – verglichen mit dem verbreiteten UTF-8- oder den ISO-8859-Zeichensätzen – etwa der vierfache Speicherplatz belegt. Deshalb wird es auch kaum zum externen Speichern verwendet. Ein weiterer Nachteil ist die fehlende Abwärtskompatibilität zu ASCII, wie sie z. B. mit UTF-8 gegeben ist.

Streng genommen kodieren sämtliche UTF-Kodierungen keine Zeichen, sondern sogenannte Unicode Codepoints. Es existieren in Unicode zusammengesetzte Zeichen, die mehr als einen Codepoint benötigen (z. B. Zeichen mit ungewöhnlichen oder mehrfachen Akzenten, wie sie im Vietnamesischen vorkommen). Sollen derartige Zeichen korrekt verarbeitet werden, ist auch in einer UTF-32-kodierten Zeichenkette kein wahlfreier Zugriff auf einzelne Zeichen möglich.

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.