Как мне прочитать строки Unicode-16 из файла, используя методы POSIX в Linux?

У меня есть файл, содержащий строки UNICODE-16, которые я хотел бы прочитать в программе Linux. Строки были записаны в сыром виде из внутреннего формата WCHAR Windows. (Windows всегда использует UTF-16? Например, в японских версиях)

Я считаю, что я могу читать их, используя необработанные чтения и преобразование с помощью wcstombs_l. Тем не менее, я не могу понять, какую локаль использовать. Запуск "locale -a" на моих современных машинах с Ubuntu и Mac OS X дает нулевые локали с utf-16 в их именах.

Есть ли способ лучше?

Обновление: правильный ответ и другие, приведенные ниже, помогли мне использовать libiconv. Вот функция, которую я использую для преобразования. В настоящее время у меня есть это внутри класса, который превращает преобразования в однострочный кусок кода.

// Function for converting wchar_t* to char*. (Really: UTF-16LE --> UTF-8)
// It will allocate the space needed for dest. The caller is
// responsible for freeing the memory.
static int iwcstombs_alloc(char **dest, const wchar_t *src)
{
  iconv_t cd;
  const char from[] = "UTF-16LE";
  const char to[] = "UTF-8";

  cd = iconv_open(to, from);
  if (cd == (iconv_t)-1)
  {
    printf("iconv_open(\"%s\", \"%s\") failed: %s\n",
           to, from, strerror(errno));
    return(-1);
  }

  // How much space do we need?
  // Guess that we need the same amount of space as used by src.
  // TODO: There should be a while loop around this whole process
  //       that detects insufficient memory space and reallocates
  //       more space.
  int len = sizeof(wchar_t) * (wcslen(src) + 1);

  //printf("len = %d\n", len);

  // Allocate space
  int destLen = len * sizeof(char);
  *dest = (char *)malloc(destLen);
  if (*dest == NULL)
  {
    iconv_close(cd);
    return -1;
  }

  // Convert

  size_t inBufBytesLeft = len;
  char *inBuf = (char *)src;
  size_t outBufBytesLeft = destLen;
  char *outBuf = (char *)*dest;

  int rc = iconv(cd,
                 &inBuf,
                 &inBufBytesLeft,
                 &outBuf,
                 &outBufBytesLeft);
  if (rc == -1)
  {
    printf("iconv() failed: %s\n", strerror(errno));
    iconv_close(cd);
    free(*dest);
    *dest = NULL;
    return -1;
  }

  iconv_close(cd);

  return 0;
} // iwcstombs_alloc()

4 ответа

Решение

(Windows всегда использует UTF-16? Например, в японских версиях)

Да, NT WCHAR всегда UTF-16LE.

("Системная кодовая страница", которая для японской установки действительно называется cp932/Shift-JIS, все еще существует в NT для многих, многих приложений, не являющихся родными для Unicode, путей FAT32 и т. Д.)

Тем не менее, wchar_t не гарантированно будет 16 бит, а в Linux его не будет, используется UTF-32 (UCS-4). Так что wcstombs_l вряд ли будет счастлив.

Правильно было бы использовать библиотеку, подобную iconv, для чтения в любом формате, который вы используете для внутреннего использования - предположительно, wchar_t. Вы могли бы попытаться взломать его самостоятельно, вставив байты, но вы, вероятно, ошиблись.

Запуск "locale -a" на моих современных машинах с Ubuntu и Mac OS X дает нулевые локали с utf-16 в их именах.

Действительно, Linux не может использовать UTF-16 в качестве кодировки по умолчанию для локали, благодаря всем \0.

Самый простой способ - конвертировать файл из utf16 в собственную кодировку UNIX utf8, а затем прочитать его,

iconv -f utf16 -t utf8 file_in.txt -o file_out.txt

Вы также можете использовать iconv(3) (см. Man 3 iconv) для преобразования строки с использованием C. Большинство других языков также имеют привязки к iconv.

Затем вы можете использовать любой язык UTF-8, например en_US.UTF-8, который обычно используется по умолчанию в большинстве дистрибутивов Linux.

Вы можете читать в двоичном виде, а затем выполнить собственное быстрое преобразование: http://unicode.org/faq/utf_bom.html Но, вероятно, безопаснее использовать библиотеку (например, libiconv), которая правильно обрабатывает недопустимые последовательности.

Я настоятельно рекомендую использовать кодировку Unicode в качестве внутреннего представления вашей программы. Используйте UTF-16 или UTF-8. Если вы используете UTF-16 для внутреннего использования, то, очевидно, перевод не требуется. Если вы используете UTF-8, вы можете использовать локаль с .UTF-8 в нем такие как en_US.UTF-8,

Другие вопросы по тегам