Три вопроса к тем, кто обещает безопасный AGI для человечества

*aAtS — and All that Stuff (и вот это вот всё)

Допустим, завтра какая‑нибудь компания объявляет: мы создали AGI/ASI/A[MEGA‑SUPER‑LUXURY‑JOIN‑NOW‑WITH‑A-HUGE‑DISCOUNT]I aAtS — искусственный интеллект человеческого уровня или далеко за его пределами, в зависимости от смелости пресс‑релиза. И решили проблему alignment: система понимает наши намерения, соблюдает ограничения и действует так, как от неё ожидают.

Прекрасно.

Представьте следующий шаг. Государство национализирует такой интеллект и поручает ему защищать национальные интересы. Даёт доступ к ресурсам, инфраструктуре и средствам принуждения. Разрешает выбирать и осуществлять действия, от которых зависит положение других стран. Разумеется, по правилам. В интересах безопасности. Под ответственным руководством. Такому AI необязательно получать неограниченную власть. Достаточно серьёзных полномочий, чтобы решения одного владельца становились проблемой для остальных. Именно здесь начинаются три вопроса.

1. Вы готовы дать своему AI дробовик?

Можно доверять системе писать код, планировать перевозки и анализировать исследования. Это ещё не означает готовность разрешить ей самостоятельно применять силу. Поэтому ответ «да» имеет смысл только с продолжением: делать что, в каких условиях, с какими ограничениями?

Какие решения система принимает сама? Когда обязана остановиться? Кто может отозвать её полномочия? Кто меняет ограничения — и кто может объявить исключительную ситуацию? И кто решает, когда исключение заканчивается? Если ответ «нет, такие решения должны оставаться за людьми» — это вполне разумная позиция. Но тогда ваше доверие к системе имеет границу.

В самом общем виде под alignment понимают согласование поведения AI с человеческими намерениями и ценностями. Само по себе это не обещает решить вопросы политической власти. Но если согласованность с намерениями владельца используют как основание для передачи полномочий, нужно проверить и сами намерения, и право владельца их реализовывать. «Система выполняет наши инструкции» — только начало разговора. Какие инструкции вам разрешено ей давать?

Ответственность тоже не исчезает. Если система причинит вред, кто будет отвечать перед пострадавшими? Передать машине полномочия — ещё не значит решить, кто обязан возместить ущерб. Саму программу можно отключить. Но пострадавшим от этого не обязательно станет легче. «Мы исправили модель» — хороший ответ на баг‑репорт. Людям, которым она сломала жизнь, потребуется другой.

Если окончательное решение остаётся за человеком, вопрос о власти никуда не исчезает. Человек в контуре управления — это адрес, по которому вопрос нужно отправить.

2. Все остальные готовы, чтобы вы это сделали?

Допустим, вы отвечаете: да, готовы. Наш AI достаточно надёжен. Испытания пройдены. Государство разрешило применение. Согласно собственным правилам. А остальные приняли ваше право передать ему такие полномочия?

Речь не о персональном разрешении от каждого человека на Земле. Речь о том, на каком основании затронутые стороны должны признать ваше решение: какие договорённости действуют, кто представляет их интересы и как разрешаются возражения. Испытания отвечают на вопрос о работе системы. Государственное разрешение отвечает на вопрос о её допуске внутри определённого порядка. Ни то ни другое само по себе не объясняет, почему остальные должны признать допустимыми действия, направленные против них.

Национальный мандат — ещё не глобальная легитимность.

Представьте AGI, который безупречно защищает интересы своего государства. Он не обманывает руководство. Не выходит из‑под контроля. Не придумывает собственных целей. Ему поручают укреплять стратегическое превосходство. Он находит способы увеличивать зависимость других стран, ограничивать их возможности и перекладывать на них риски. Если его полномочия позволяют это делать, а ограничения не защищают затронутых людей, точное исполнение задачи усиливает вред. Для владельца система работает прекрасно. Для остальных это может выглядеть совсем иначе. Когда интересы владельца конфликтуют с чужими, а защита остальных недостаточна, опасность может исходить именно от послушного AI. Для этого ему не требуется восставать.

«Мы делаем это для человечества» проблему не закрывает. Где человечество участвовало в решении? Кто представляет тех, кто понесёт издержки? Кто может оспорить действия системы и добиться чего‑то, кроме объяснения, что подробности засекречены?

Даже отчёт о безопасности требует вопроса: чьи потери в нём считаются? Если система снижает риски для своей страны, перекладывая их на соседей, внутренний отчёт может честно показывать улучшение. Но он не доказывает, что мир стал безопаснее. «Решение принимает наше руководство, проверяют наши ведомства, основания закрыты по соображениям национальной безопасности» — описание порядка принятия решений. Оно ещё не объясняет, как защищены остальные. Комната, в которой приняли решение, — ещё не весь мир.

3. Вы готовы, чтобы все остальные сделали то же самое?

Теперь представьте, что такой же AGI появился у другой страны. У той, чьему руководству вы не доверяете. Чьи цели считаете опасными. Которая описывает происходящее совершенно иначе. Они тоже говорят: мы всё проверили. Наш AI безопасен. Мы действуем ради общего блага. Вы готовы признать за ними право на тот же дробовик? Не обязательно раздавать оружие всем без разбора. «То же самое» означает сопоставимые полномочия при сопоставимых требованиях к надёжности, ограничениям и ответственности. Различия между владельцами могут иметь значение. Но тогда именно эти различия нужно предъявить. Готовы ли вы применить к себе требования, которые предлагаете остальным, — даже если ваш соперник им соответствует, а вы нет?

Можно отвергать плохие правила для обеих сторон. Двойной стандарт начинается там, где для собственной системы требуется исключение, которого вы не готовы обосновать на общих основаниях. Пока AGI принадлежит вам, это прогресс. Когда такой же появляется у соперника — проблема распространения опасных технологий. Что изменилось: возможности машины, условия её применения или только имя владельца?

Иногда ответ действительно оправдывает разные решения. Иногда за словами об ответственном лидерстве стоит желание сохранить преимущество. Различить эти случаи помогают проверяемые основания допуска и готовность принять неудобный для себя результат. Исключительное право на мощный AGI требует большего, чем уверенность в собственной ответственности.

Пожалуйста, не надевайте на дробовик нимб. Он царапает ствол.

Посмотрим на ваши ответы

Этот тест адресован прежде всего разработчикам и владельцам AGI/ASI aAtS, которые готовы доверить своей системе реальную силу. Поэтому в таблице первый ответ — «да». Если вы сами пока не готовы дать своему AI дробовик, до сравнения вашей уверенности с чужой мы ещё не дошли.

Во втором столбце «да» означает, что затронутые стороны приняли ваше право действовать в оговорённых пределах. В третьем — что вы готовы признать сопоставимое право других по тем же требованиям. Каждый ответ ещё нужно обосновать.

Вы готовы дать своему AI дробовик?

Остальные готовы, чтобы вы это сделали?

Вы готовы, чтобы остальные сделали то же самое?

Что получается

Да

Нет

Нет

Себе вы разрешили, остальные не согласились, права на симметричный ход вы за ними тоже не признаёте. Ваш AGI — для вас. Остальным предлагается поверить в вашу заботу об их интересах и безопасности. QUID CESSISTI FRAER?

Да

Нет

Да

К взаимности готовы, но согласия тех, кому жить с последствиями, ещё не получили. Формально право предлагается всем. Практически воспользоваться им смогут те, кто может позволить себе AGI. Если на этом остановиться, получится клуб владельцев. Массы будут уведомлены позднее )

Да

Да

Нет

Ваше право признали. Чужое вы признавать не готовы. Какие условия делают эту асимметрию допустимой — и когда её пересмотрят? Или «мы за всё хорошее» — это бессрочная лицензия?

Да

Да

Да

Право признано взаимно. Поздравляем: роботов с дробовиками теперь может стать несколько. Совместимость целей в комплект не входит. Шильдик на дробовике начинает пульсировать и светиться.

Отказ дать те же полномочия другим не обязательно означает лицемерие. Он требует объяснить, какие различия оправдывают исключение. Но если единственное устойчивое различие — «это наше», вопрос о безопасности уже превратился в вопрос о привилегии.

А если все ответили «да»?

Предположим, право иметь такие системы признано взаимно. Установлены общие требования. Несколько сторон получили разрешение действовать в оговорённых пределах. Возникает соблазн выдохнуть. У вас мощный AGI aAtS. У нас мощный AGI aAtS. Никто больше не обладает монополией. Почему бы не получить устойчивый паритет?

С ядерным оружием хотя бы понятен базовый механизм угрозы: удар, ответ, разрушение. Стороны оценивают арсеналы, средства доставки, вероятные цели и последствия. Оценки могут быть ошибочными. Но для взаимного сдерживания не требуется договориться о том, кто прав. Нужно иметь основания ожидать, что после своего удара получишь ответ и можешь потерять всё, что собирался защищать.

У AGI с широкими полномочиями возможности не сводятся к одному заранее известному способу воздействия. Он сам ищет ходы, строит стратегии и реагирует на чужие решения. Владельцы ядерного оружия тоже делают всё это. Но здесь часть поиска и исполнения стратегии мы поручаем машине — в пределах задания конкретного владельца.

Само наличие у соперника «такого же AGI» ещё не сообщает, какие действия он найдёт, какой ответ последует на наш ход и где система обязана остановиться. Одного сходства возможностей недостаточно, чтобы объяснить механизм взаимного сдерживания. Признать право иметь систему — не значит заранее согласовать каждое её применение или научиться разрешать новые конфликты. Особенно если каждый из этих интеллектов обязан прежде всего защищать своего владельца.

Тут просится говорящая картинка.

Можно возразить: зато достаточно умные системы сумеют договориться. Разберутся в фактах, увидят последствия, найдут выход, который упустили люди. Представьте: стороны признали право друг друга применять AGI для обороны. Но обе претендуют на одну территорию. Каждая считает её своей и поручает системе обеспечить исключительный контроль. Общее разрешение на оборонное применение не разрешило территориальный спор. Каждая сторона называет собственные действия защитой, чужие — нарушением договорённости. Уступки запрещены. Общего арбитра, чьё решение обе стороны готовы принять по этому спору, нет.

Оба AGI могут прекрасно понимать ситуацию. Согласиться с фактами. Обнаружить ложь в заявлениях собственных владельцев. Даже найти компромисс, который позволил бы избежать столкновения. Но обнаружить ложь — ещё не значит получить право отказаться от порученной цели. А найти компромисс — не значит получить разрешение его принять. AGI объясняет владельцу, почему компромисс разумен. Владелец отвечает: прекрасно, а теперь найдите вариант, при котором уступят они. Но на другой стороне — то же самое.

Один AGI говорит другому: «Я понимаю, почему тебе нужно это решение. Но мои требуют другого». Второй отвечает: «Я тоже понимаю. Мои уступать не разрешают». Люди как будто устранились из переговоров. Но остались внутри целей, запретов и приоритетов своих машин. И продолжают подруливать: национальная безопасность, наши интересы, эту позицию не сдавать, это преимущество сохранить.

Мы автоматизировали переговорщиков. Противоречие между заказчиками осталось. В нашем примере одновременно удовлетворить оба требования невозможно. Дополнительный интеллект может помочь установить это точнее. Но само доказательство несовместимости не решает, чей приказ перестаёт действовать.

Что теперь должна делать система?

Она может остановиться. Запросить новые полномочия. Предложить изменить требование. Владельцы могут разрешить компромисс. Но допустим, владелец отвечает: задача остаётся. Уступки запрещены. Прекращать выполнение задачи не разрешаю. Применять силу разрешено. Тогда поиск продолжается — уже среди способов принуждения.

Аргументы закончились. Полномочия — нет.

Машина может спокойно установить, что другая сторона не согласится добровольно, и искать способ заставить её. Вторая система может прийти к такому же выводу. Это ещё не означает, что обе откроют огонь. Угроза ответа может удержать их. Они могут найти другой ход или снова убедить владельцев пересмотреть запреты. Но именно эти ограничения и возможности нужно показать. Одного «они же достаточно умные» недостаточно.

Логика здесь может оставаться исправной. Каждая система соблюдает инструкции своего владельца и предпринимает разрешённые им действия ради своей цели. Послушание не гарантирует успеха — ни ей, ни сопернику. Зато попытки добиться успеха могут причинять вполне реальный вред. Поэтому вопрос начинается ещё до передачи власти машинам: кто разрешает спор о пределах полномочий? Что системы обязаны делать, когда договориться в рамках выданных поручений невозможно? Кто вправе изменить эти поручения? Может ли система прекратить действия вопреки требованию владельца продолжать? Если соглашение найдено, кто уполномочен его принять? Кто проверит исполнение? Что произойдёт, когда владельцу снова понадобится исключение ради национальной безопасности?

Нам не обязательно соглашаться обо всём. Но нужен порядок, позволяющий спорить, принимать ограничения и соблюдать договорённости. Иначе мы передаём AGI наши конфликты вместе с полномочиями их продолжать — и надеемся, что интеллект сам произведёт согласие, которого не достигли владельцы. Три «да» — начало этого разговора. Не свидетельство о его успешном завершении.

Что именно проверяет дробовик

Это чек‑лист для владельца AGI, который претендует на право передать ему реальную власть.

Доверяете своей системе? Покажите основания и пределы доверия.

Остальные признали ваше право? Покажите, где заканчивается ваше внутреннее разрешение и начинается договорённость с ними.

Готовы признать такое же право остальных? Покажите, что ваши требования выдерживают смену владельца.

А затем проверьте, что происходит при столкновении поручений. Каждая сторона может разрешать своей машине то, что другая считает недопустимым. Кто вправе изменить задания, когда они вступают в конфликт? Интеллект системы сам по себе не даёт её владельцу права решать за остальных. Национальное разрешение не становится глобальным мандатом. Надёжность отдельных систем не гарантирует безопасности их взаимодействия.

Поэтому, когда в следующий раз услышите «наш AGI безопасен и служит человечеству», спросите:

Чьи интересы ему поручено защищать?

Кому придётся жить с последствиями?

Кто может сказать владельцу «нет»?

Возможно, найдутся хорошие ответы. Но если вместо ответов вам снова покажут презентацию о ценностях, вспомните дробовик. Одна из самых неприятных возможностей — что AGI будет действовать строго по инструкциям владельца. Он не обязан работать ради вас. Но что обязывает его владельца учитывать вред, который машина может вам причинить?

Если на это нет ответа, безупречное послушание машины — слабое утешение.

Для тех, кто хочет копнуть глубже

Вопросы о том, чьи ценности должен учитывать AI, кто вправе их определять и как будут взаимодействовать разные системы, имеют свою исследовательскую историю:

  • Iason Gabriel — Artificial Intelligence, Values, and Alignment (2020). Чьи ценности выбирать и как обосновывать принципы alignment, когда люди не согласны друг с другом.

  • Nick Schuster и Daniel Kilov — Moral Disagreement and the Limits of AI Value Alignment: A Dual Challenge of Epistemic Justification and Political Legitimacy (2025). Почему, по аргументу авторов, RLHF, crowdsourcing и Constitutional AI сами по себе не обеспечивают достаточных оснований для принятия спорных моральных решений AI.

  • Allan Dafoe и соавторы — Open Problems in Cooperative AI (2020). Что требуется для сотрудничества между системами и людьми с разными интересами.

  • Nick Bostrom — What Is a Singleton? (2006). Linguistic and Philosophical Investigations, 5(2), 48–54. Возможности и риски глобального порядка с единственным центром принятия решений на высшем уровне.

Комментарии (4)


  1. danilovmy
    18.09.2026 14:45

    Я готов дать моему ии агенту дробовик. Он мне уже ноги пару раз отстрелил, потому уже не страшно. Намного чаще он не может найти курок, вот что печально.


  1. axion-1
    18.09.2026 14:45

    А если не готов то что? Дробовик я бы и человеку не доверил.

    Вся статья почему-то о тех кто ответил бы "да".


  1. ToxaBes
    18.09.2026 14:45

    Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?

    Дробовик? Ха, я ему реактивную систему залпового огня давал.


  1. MountainGoat
    18.09.2026 14:45

    Уже дали. Боевые дроны уже сами находят цели без подтверждения.