Как мне прочитать строки Unicode-16 из файла, используя методы POSIX в Linux?
У меня есть файл, содержащий строки UNICODE-16, которые я хотел бы прочитать в программе Linux. Строки были записаны в сыром виде из внутреннего формата WCHAR Windows. (Windows всегда использует UTF-16? Например, в японских версиях)
Я считаю, что я могу читать их, используя необработанные чтения и преобразование с помощью wcstombs_l. Тем не менее, я не могу понять, какую локаль использовать. Запуск "locale -a" на моих современных машинах с Ubuntu и Mac OS X дает нулевые локали с utf-16 в их именах.
Есть ли способ лучше?
Обновление: правильный ответ и другие, приведенные ниже, помогли мне использовать libiconv. Вот функция, которую я использую для преобразования. В настоящее время у меня есть это внутри класса, который превращает преобразования в однострочный кусок кода.
// Function for converting wchar_t* to char*. (Really: UTF-16LE --> UTF-8)
// It will allocate the space needed for dest. The caller is
// responsible for freeing the memory.
static int iwcstombs_alloc(char **dest, const wchar_t *src)
{
iconv_t cd;
const char from[] = "UTF-16LE";
const char to[] = "UTF-8";
cd = iconv_open(to, from);
if (cd == (iconv_t)-1)
{
printf("iconv_open(\"%s\", \"%s\") failed: %s\n",
to, from, strerror(errno));
return(-1);
}
// How much space do we need?
// Guess that we need the same amount of space as used by src.
// TODO: There should be a while loop around this whole process
// that detects insufficient memory space and reallocates
// more space.
int len = sizeof(wchar_t) * (wcslen(src) + 1);
//printf("len = %d\n", len);
// Allocate space
int destLen = len * sizeof(char);
*dest = (char *)malloc(destLen);
if (*dest == NULL)
{
iconv_close(cd);
return -1;
}
// Convert
size_t inBufBytesLeft = len;
char *inBuf = (char *)src;
size_t outBufBytesLeft = destLen;
char *outBuf = (char *)*dest;
int rc = iconv(cd,
&inBuf,
&inBufBytesLeft,
&outBuf,
&outBufBytesLeft);
if (rc == -1)
{
printf("iconv() failed: %s\n", strerror(errno));
iconv_close(cd);
free(*dest);
*dest = NULL;
return -1;
}
iconv_close(cd);
return 0;
} // iwcstombs_alloc()
4 ответа
(Windows всегда использует UTF-16? Например, в японских версиях)
Да, NT WCHAR всегда UTF-16LE.
("Системная кодовая страница", которая для японской установки действительно называется cp932/Shift-JIS, все еще существует в NT для многих, многих приложений, не являющихся родными для Unicode, путей FAT32 и т. Д.)
Тем не менее, wchar_t не гарантированно будет 16 бит, а в Linux его не будет, используется UTF-32 (UCS-4). Так что wcstombs_l вряд ли будет счастлив.
Правильно было бы использовать библиотеку, подобную iconv, для чтения в любом формате, который вы используете для внутреннего использования - предположительно, wchar_t. Вы могли бы попытаться взломать его самостоятельно, вставив байты, но вы, вероятно, ошиблись.
Запуск "locale -a" на моих современных машинах с Ubuntu и Mac OS X дает нулевые локали с utf-16 в их именах.
Действительно, Linux не может использовать UTF-16 в качестве кодировки по умолчанию для локали, благодаря всем \0.
Самый простой способ - конвертировать файл из utf16 в собственную кодировку UNIX utf8, а затем прочитать его,
iconv -f utf16 -t utf8 file_in.txt -o file_out.txt
Вы также можете использовать iconv(3) (см. Man 3 iconv) для преобразования строки с использованием C. Большинство других языков также имеют привязки к iconv.
Затем вы можете использовать любой язык UTF-8, например en_US.UTF-8, который обычно используется по умолчанию в большинстве дистрибутивов Linux.
Вы можете читать в двоичном виде, а затем выполнить собственное быстрое преобразование: http://unicode.org/faq/utf_bom.html Но, вероятно, безопаснее использовать библиотеку (например, libiconv), которая правильно обрабатывает недопустимые последовательности.
Я настоятельно рекомендую использовать кодировку Unicode в качестве внутреннего представления вашей программы. Используйте UTF-16 или UTF-8. Если вы используете UTF-16 для внутреннего использования, то, очевидно, перевод не требуется. Если вы используете UTF-8, вы можете использовать локаль с .UTF-8
в нем такие как en_US.UTF-8
,