
Если вся вторая половина века XX‑го и начало XXI‑го веков проходили под знаком глобализации, то теперь, если верить Хантингтону (я имею ввиду его работу «Столкновение цивилизаций»), нас ждет многополярный мир, разделенный на несколько цивилизаций. Несмотря на то, что книга написана в далеком уже 1996 году, события последних лет говорят о том, что она не только не устарела, но стала еще более актуальной.
Кроме того, внутри одних общностей иммиграция стала создавать значительные локальности иных по отношению к принимающей, неохотно смешиваемых, культур.
Еще один фактор — это обосабливание некогда общих культур. Если основной тенденцией эпохи однополярного мира после холодной войны и нацеленности на создание единой глобальной экономики и повсеместной вестернизации, было стирание границ, то сегодня нас ждет обратный процесс. Более того, по мысли Хантингтона он не прекращался и в более или менее скрытом виде наблюдается уже с 80–90-х годов прошлого века.
Если с первыми двумя факторами более‑менее все понятно, по крайней мере в отношении их культурного и лингвистического анализа, то с последним не все так просто. Так, в случае «простого» смешения и/или пересечении семантических полей изначально обособленных общностей, наше понимание упрощается несколькими факторами.
Во‑первых, семантическое ядро изначально изолированных культур имеет четкие границы, что значительно упрощает применение, например, таких инструментов как TF‑IDF и BM25.
Во‑вторых, эти культуры существуют достаточно давно и на протяжении истории возникло довольно большое количество исследований.
В‑третьих, принципиальные языковые различия позволяют легко отделить одни корпуса текстов от других.
Конечно, здесь существуют как минимум две проблемы о которых писал, в частности, Умберто Эко.
Во‑первых, это проблема невозможности точного перевода с одного языка на другой, суть которой в том что невозможно «просто» сопоставить два корпуса текстов из‑за разницы культурного и исторического опыта. За пределами простых случаев, перевод связан с невозможностью точного сопоставления ментальных образов двух текстов. В качестве простого примера мы можем привести проблему цветового и органолептического описания. Далеко ходить не надо. Это, например, и пресловутая проблема синего и зеленого цветов и разные ассоциации, связанные с запахами. Это и различия в ассоциативных полях, сформированных культурно‑исторически. Например, речь идет о метафорах, типовых описаниях добра и зла и многое‑многое другое.
Во‑вторых, проблема построения онтологий. А именно, проблема зависимости смысла от контекста и невозможности построить универсальных тезаурусов. Умберто Эко пишет о том, что смыслы складываются скорее в сети, нежели в деревья.
Гораздо более сложная картина получается в случае распада некоторых общностей, усугубляемая их дрейфом к другим культурам. В качестве примеров приведу четыре случая:
Первый пример — это проблема распада Британской империи, когда в результате мы видим много обособленных регионов, которые вроде бы используют один язык — английский, но смыслы вкладываемые в слова и идиомы начинают сильно различаться. Это касается наблюдаемой картины с австралийским, индийским (по сути) диалектами английского языка.
Второй относится к особенностям инженерной терминологии в Северном и Южном корейском языке. Северокорейские термины основываются на китайской инженерной культуре. В то время как Южнокорейские‑на японской.
Третий относится к обнаруженным мной особенностям, например, при анализе и парсинге ФИО. Если раньше, при СССР, существовали более‑менее единые нормы для всех паспортных и иных аналогичных учреждений, то теперь даже написанные кариллицей, они начинают выглядеть совершенно по разному. Например, если раньше двойные фамилии писались преимущественно через дефис, то теперь часто в документах можно видеть просто кортеж слов. Если раньше суффиксы типа «оглы», «кызы» писались через дефис, то теперь — нет. Более того, встречается в документах приписка с национальными обращениями типа «ханум». Сегодня мы видим, по сути, отсутствие фамилий в документах бывших советских республик. Да, были и раньше сложности с арабскими кортежами типа «сын того‑то сын‑того то» и (так до бесконечности), но это касалось иностранных (в тех условиях) граждан. А все документы СНГ имели поле с фамилией. Или сильная контекстная зависимость понимания значения слов «Ван», «Бен» и так далее
Четвертое: сегодня относительная линейность при транслитерации перестает работать. Это касается как «простых» случаев, таких как склонность китайцев не транслитерировать свои имена, а придумывать новые (латинизированные для внешних каналов коммуникации) имена. Или существующие факты о необходимости знать особенности транслитерации внутри одних алфавитов даже при условии общей языковой базы. Речь идет, например, о невозможности «простой» транслитерации при формировании каталогов SKU, ЗИП. Например, в случае создания систем учета запасных частей и инструментов при поставках сложной техники на экспорт.
И это только вершина айсберга. В целом, старые проблемы типа коротких длин полей как когда‑то в Siebel или разнесения поля с адресом по типу address_line_1, address_line_2 теперь покажутся мелкими неприятностями.
Такие изменения, как мне кажется, приводят к необходимости пересмотра подхода к подготовке обучающих выборок и самой стратегии применения тех или иных уже обученных моделей. Все это приводит к необходимости создания новых, по сути, инструментов, обеспечивающих:
Дополнительно, к существующим разметкам (языковым, отраслевым, стилистическим) необходимо добавить еще и культурологическую. Т.е. мы не просто должны разметить корпуса подаваемых для обучения текстов, но и добавить еще один параметр — признак культурного кода.
При формировании запросов необходимо учитывать в пространстве какого культурного кода сформирована та выборка, на которой обучалась экзаменуемая нами модель.
При проектировании диалоговых систем (например, чат‑ботов) необходимо вводить блок предварительного анализа того, какую культурную общность представляет пользователь. Причем, простого вопрошания типа: «чей ты будешь?» недостаточно. Необходима, в частности, новая стратегия, позволяющая предсказать все эти особенности.
Т.е. требуется применение более расширенного инструментария, где «простого» дополнения RAG или применения разного рода ассистентов становится недостаточно.
В практическом плане, такого рода тенденции на новую регионализацию мира ставит новые задачи перед системами так или иначе связанными с обеспечением качества данных, автоматическим распознаванием документов (договоров, резюме так далее), ведением разного реестров и управления данными (будь‑то CDI, MDM, ERP и так далее решения), маппингом одних сущностей на другие, поиском аналогов и дедубликации.
Таким образом, оказавшись на пути деглобализации, мы сегодня стоим на пороге нового этапа, требующего аудит и пересмотр существующих стратегий при работе с данными и LLM, в частности.
Комментарии (7)

MountainGoat
21.08.2026 14:40То, что Россия отключила себя от цивилизации, а США с Китаем делят налоги — это всё ни разу не деглобализация.

MaximKovalev Автор
21.08.2026 14:40Боюсь, что все сложнее. Тут верно и первое и второе. Почитайте, наример, Хантингтона "Столкновение цивилизаций"
blvckr3d
Think global, act local
Dhwtj
MaximKovalev Автор
хейтить легко, но вот конструктивно поспорить - интересне. Хотелось бы увидеть конструктивную критику. Именно для этого япишу. Мне важно любое мнение: и положительое и отрицательное. И прежде всего - критическое. Без этого сложно корректировать свои идеи.
Статьей я хотел прежде всего показать, что инженерные проблемы неразрывно связаны с социальными, культурными, политическими и т.д. Все в этом мире взаимосвязано.
InsiderCrush
Максим, если хочется конструктивно поспорить, могу предложить обсудить такую мысль. Сейчас большая часть ментальной энергии авторов тратится не на написание статей, а на то, как заглушить ии детекторы. Авторы боятся любого ИИ следа и разоблачения. И писать хочется, и есть о чем, и это правда интересно другим, но нет времени набивать руками. Огромный соблазн привлечь ллм. А потом искусственно "состарить", "сгрубить" текст. И все равно уши торчат - логика построения блоков и так далее. След ИИ прямо в скелет статей проникает. Или такое Вам не интересно будет обсуждать?
MaximKovalev Автор
Хорошая тенма для статьи. Напишу и обсудим.