Вы выпускаете обновления и исправляете баги, но пользователи все равно говорят: «Продукт сырой». Что именно не так и что чинить в первую очередь? Мы разложили ощущение «сырости операционной системы» на четыре измеримых компонента: надежность, функциональность, производительность и удобство — и собрали из них индекс зрелости от 10 до 50 баллов.
Привет, Хабр! Меня зовут Маргарита Урбанович, эту статью я подготовила вместе с коллегой Марией Копачевской. Мы работаем в отделе изучения пользовательского опыта в YADRO и исследуем, как люди пользуются мобильной и десктопной операционными системами, планшетами, ноутбуками, ПК и другими продуктами под брендом KVADRA. В этом материале расскажем, как появилась методика измерения зрелости ОС, из чего она состоит, как мы ее проверяли и для каких задач используем. А еще поделимся файлом с автоматическим расчетом показателей, чтобы вы могли переиспользовать методику в своих исследованиях.
Почему жалобы на «сырость» нельзя игнорировать
На юзабилити-тестах планшетов KVADRA участники нередко говорили: «планшет сыроват» или «устройство сырое». При этом объяснить, что именно не так, могли не всегда.
Параллельно мы увидели, что «сырость» входит в тройку самых частых проблем, с которыми обращаются в клиентскую поддержку, и встречается примерно в 7% отзывов о продукте. Команде стало важно понять, что пользователи называют «сыростью» и из каких признаков складывается это ощущение.
Чтобы превратить расплывчатую жалобу на «сырость» устройства в понятный и измеримый показатель, мы прошли пять этапов: от анализа пользовательских формулировок и проверки гипотез до создания и тестирования собственной методики.
Изучили отзывы и обращения. Собрали типичные формулировки: «работает не так, как ожидаешь», «много багов», «устройство тормозит». Это помогло увидеть первые повторяющиеся признаки.
Собрали гипотезы команды. В первоначальный список вошли не только операционная система и приложения, но и внешний вид устройства, материалы корпуса, техническая поддержка и известность бренда.
Посмотрели стандарты и модели зрелости. Готовой методики для операционных систем не нашли, зато получили полезную структуру критериев и терминов.
Провели количественный опрос. Проверили, что люди относят к «сырости», какие признаки считают главными и какие наши гипотезы не подтверждаются.
Собрали и протестировали собственную методику. Сформулировали вопросы, придумали способ подсчета и проверили методику на пользователях смартфонов.
Что подсказали существующие стандарты и модели
Большинство найденных моделей оценивают не конкретный продукт, а зрелость процессов разработки в организации. Тем не менее они помогли понять, как специалисты описывают переход от «незрелого» к устойчивому и качественному решению. Вот модели, которые мы изучили:
ISO/IEC 15504, или SPICE (Software Process Improvement and Capability Determination), — набор стандартов для оценки и улучшения процессов разработки программного обеспечения.
Technology Readiness Levels (TRL) — шкала из девяти уровней, созданная NASA для оценки готовности технологий. Для ОС она слишком тяжеловесна, но полезна как пример поэтапной оценки зрелости.
Capability Maturity Model Integration (CMMI) — модель зрелости процессов разработки и поддержки.
Trillium Model — модель Bell Labs, объединившая требования ISO 9000, CMM и критерии Baldrige. Особенно известна в телекоммуникациях.
Ближе всего к нашей задаче оказался стандарт качества систем и программных продуктов ISO/IEC 25010:2011. Его российский аналог — ГОСТ Р ИСО/МЭК 25010. Стандарт описывает качество продукта и взаимодействия пользователя с системой.
По итогу поиска мы сформулировали такое определение: незрелость операционной системы — это недоработанность, которая проявляется в ошибках, нестабильности, уязвимостях, слабой совместимости и недостаточной оптимизации. Зрелость — способность системы или ее компонента надежно выполнять свои функции в обычных условиях эксплуатации.
В ISO/IEC 25010 выделены восемь характеристик качества:
функциональная пригодность,
производительность,
совместимость,
удобство использования,
надежность,
защищенность,
сопровождаемость,
переносимость.
Этот список стал теоретической опорой, не готовой анкетой. Нам было важно сохранить пользовательское понимание слова «сырой». Поэтому следующий шаг — спросить самих пользователей.
Как пользователи понимают «сырость»
Это был опрос с закрытыми и открытыми вопросами. Его мы составили на основе анализа отзывов и обращений в поддержку, списка известных багов, а также обратной связи из глубинных интервью. В опросе мы спрашивали, что означает выражение «сырая операционная система», какие слова люди считают близкими по смыслу, как быстро замечают «сырость» и насколько разные проблемы соответствуют этому понятию.
На вопросы отвечали, как пользователи KVADRA, так и владельцы других устройств. Ответы распределились четко: чем сильнее проблема мешает выполнить задачу, тем чаще ее связывают с «сыростью».
Доля участников |
Что происходит |
Категория |
Пример |
Более 86% |
Действие невозможно выполнить |
Ненадежность |
Ошибка при копировании файла Самопроизвольная перезагрузка |
66-85% |
Не хватает ожидаемых функций |
Недостаточная функциональность |
В приложении нет привычной функции |
46-65% |
Устройство работает медленно |
Низкая производительность |
Приложения долго открываются Экран медленно реагирует |
26-45% |
Для использования нужны лишние усилия |
Неудобство |
Поиск нужной функции занимает пять минут |
Менее 25% |
Большинство не считает это признаком «сырости» |
Не относится к «сырости» |
Вес около 600 г Плоские боковые грани |
Характеристики самого устройства (цвет, материалы корпуса, вес, время работы от аккумулятора), а также известность бренда и наличие технической поддержки участники вынесли в отдельную группу. Большинство не связывало их с «сыростью», поэтому мы не включили их в методику.
Получившиеся категории частично совпали с ISO/IEC 25010, но не повторили стандарт полностью. Например, безопасность и совместимость почти не звучали в ответах пользователей.
Поскольку «сырость» обычно противопоставляют зрелости, мы перевели негативные признаки в позитивные цели. В итоге осталось четыре компонента:
Компонент |
Вес |
Что оцениваем |
Надежность |
1 |
Стабильность, исправность, отсутствие сбоев |
Функциональность |
0,75 |
Наличие нужных и ожидаемых возможностей |
Производительность |
0,5 |
Скорость работы и отклика |
Удобство |
0,25 |
Понятность интерфейса и простота выполнения задач |
Надежность получила самый большой вес: именно сбои и ошибки почти все участники опроса называли главным признаком «сырости». Остальные компоненты тоже важны, но мнения о них были менее однозначными. Веса мы назначили, опираясь на результаты опроса.
Как мы собрали опросник
Это оказался самый насыщенный этап. Мы провели около семи командных сессий, нарисовали пятнадцать вариантов структуры, сформулировали около шестидесяти утверждений и оставили шестнадцать самых точных. Заодно следили, чтобы они не дублировали существующие UX-опросники вроде UMUX, SUS, CSAT и т. д.
Каждое утверждение должно было измерять только один компонент и быть понятным без дополнительных пояснений. Поэтому мы отказались от фраз в духе «Я доволен тем, как работает мое устройство»: она одновременно относится к надежности, скорости, функциональности и удобству.
Отдельно проверили слово «глючить». Внутри команды его связывали и со сбоями и медленной работой. Пользовательский опрос показал, что оно ближе к надежности, поэтому соответствующее утверждение вошло именно в этот блок.
Мы также старались не привязывать методику к конкретной ОС и устройству (в нашем случае — к планшету). Формулировки касаются зрелости продукта в целом, поэтому опросник можно адаптировать для разных операционных систем и, возможно, приложений.
Полная версия методики
На таблице «+» — прямое утверждение, «-» — обратное, его оценку нужно перевести перед подсчетом.
Надежность, вес — 1 | |
Простое определение |
Все работает стабильно, исправно и без сбоев. |
Утверждения |
Мое устройство работает исправно, стабильно и без сбоев. (+) Во время работы я сталкиваюсь с техническими проблемами. (-) На устройстве иногда появляются сообщения об ошибках. (-) Во время использования устройство не «глючит». (+) |
Функциональность, вес — 0,75 | |
Простое определение |
На устройстве есть нужные возможности, и они работают так, как ожидается. |
Утверждения |
Меня полностью устраивает функциональность устройства. (+) На устройстве не хватает функций для выполнения моих задач. (-) Функциональность устройства не соответствует современным требованиям к устройствам такого класса. (-) На устройстве есть все базовые функции, которыми я обычно пользуюсь. (+) |
Производительность, вес — 0,5 | |
Простое определение |
Устройство быстро запускает приложения и реагирует на действия пользователя. |
Утверждения |
Приложения открываются быстро, мне не приходится ждать. (+) Производительность устройства соответствует моим ожиданиям. (+) На мой взгляд, устройство работает медленно и «тормозит». (-) Устройство долго реагирует на касания и жесты на экране. (-) |
Удобство, вес — 0,25 | |
Простое определение |
Интерфейс понятен, а привычные задачи выполняются без лишних усилий. |
Утверждения |
Интерфейс устройства выглядит перегруженным, в нем сложно разобраться. (-) Мне привычно пользоваться устройством. (+) Я часто запутывался и не понимал, что делать дальше, чтобы решить задачу. (-) Система на моем устройстве очень простая: я быстро выполняю все нужные задачи. (+) |
Как считать итоговый балл
Участник оценивает каждое из 16 утверждений по шкале от 1 до 5, где 1 — «совершенно не согласен», а 5 — «полностью согласен». Утверждения лучше показывать в случайном порядке.
Перед подсчетом итогового балла по обратным утверждениям нужно перевести оценку в прямую шкалу. Для этого использовали правило «6 минус ответ»: 1 превращается в 5, 2 — в 4, 3 остается 3, 4 превращается в 2, а 5 — в 1. После этого все оценки можно складывать.
Индекс зрелости = Н + (Ф × 0,75) + (П × 0,5) + (У × 0,25), где Н, Ф, П и У — суммы четырех ответов по каждому компоненту после разворота обратных утверждений.
Минимальный итог — 10 баллов, максимальный — 50. Чем выше результат, тем более зрелым пользователи воспринимают программное обеспечение на конкретном устройстве — в нашем случае операционную систему.
Надежность: от 4 до 20 баллов.
Функциональность: от 3 до 15 баллов.
Производительность: от 2 до 10 баллов.
Удобство: от 1 до 5 баллов.
Полезно смотреть не только на общий индекс, но и на каждый компонент отдельно. Так видно, что уже работает хорошо, а что сильнее всего снижает общую оценку.
Не переоценивайте десятые. Разница между 45,2 и 45,4 балла не означает заметного изменения продукта. Методика измеряет субъективное восприятие, поэтому небольшие различия нужно интерпретировать осторожно.
Как мы проверили методику
Для первой проверки мы выбрали смартфоны: люди пользуются ими постоянно, а на рынке достаточно разных операционных систем и брендов для сравнения.
В опросе участвовали 300 человек старше 18 лет из разных городов России. Они указали марку и модель смартфона, оценили устройство по нашей шкале, а также ответили на вопросы CSAT и CES. После проверки качества данных для анализа осталось 278 анкет.
Мы выделили десять брендов, по которым набралось достаточно ответов и распределили их по группам с близким количеством респондентов-владельцев. Внутри этих групп результаты сравнивали между собой. Например, iPhone оценивали 50 владельцев, а Samsung — 52, поэтому эти бренды можно было сопоставлять напрямую. Бренды, представленные 14-20 владельцами, анализировали отдельно: сравнивать их с группой из 50 и более респондентов было бы некорректно из-за большой разницы в объеме выборок. Бренды, по которым набралось пять ответов и меньше, исключили из сравнения.
Марка |
Надежность |
Функциональность |
Производительность |
Удобство |
Индекс зрелости |
iPhone |
18,1 |
14,3 |
9,6 |
4,7 |
46,6 |
Infinix |
17,5 |
12,9 |
9,1 |
4,6 |
44 |
Honor |
17,3 |
13,1 |
8,7 |
4,6 |
43,5 |
Huawei |
17,0 |
13,0 |
8,6 |
4,5 |
43 |
Tecno |
16,1 |
13,1 |
8,9 |
4,9 |
42,9 |
Realme |
16,1 |
12,4 |
8,4 |
4,4 |
41,8 |
Samsung |
15,9 |
13,2 |
8,3 |
4,6 |
41,9 |
POCO |
15,9 |
13,4 |
8,7 |
4,5 |
42,4 |
Xiaomi |
15,7 |
12,5 |
8,2 |
4,4 |
40,8 |
Redmi |
14,7 |
12,6 |
8,0 |
4,3 |
39,1 |
В группе брендов с наибольшим числом ответов сравнивали Apple и Samsung: устройства этих брендов оценили 50 и 52 владельца соответственно. iPhone опередил Samsung почти на пять баллов и получил самые высокие оценки за надежность, функциональность и производительность. В общем рейтинге зрелости он занял первое место, а Samsung оказался на шесть позиций ниже.
В группе брендов, по которым получили от 20 до 43 ответов, сравнивали смартфоны Honor, POCO, Xiaomi и Redmi. Самые низкие индексы зрелости оказались у Xiaomi и Redmi. Лидером группы стал Honor — как по общему индексу, так и по оценке надежности.
Меньше всего ответов собрали устройства Huawei, Infinix и Tecno. Их общие индексы зрелости различались незначительно. При этом Tecno получил самую высокую оценку за удобство — 4,9 балла, став лидером не только в своей группе, но и среди всех брендов. В целом оценки удобства оказались близкими: от 4,3 до 4,9 балла.
В середине списка разрывы невелики и часто измеряются десятыми. Между крайними значениями разница заметнее — около восьми баллов. Это показывает, что методика различает устройства по воспринимаемой зрелости, но не превращает небольшие колебания в громкие выводы.
Как влияет цена смартфона
До опроса мы предполагали, что более дорогие смартфоны будут восприниматься как более зрелые. Устройства распределились так: 52% — бюджетные модели до 25 тысяч рублей, 24% — средний сегмент от 25 до 40 тысяч рублей, 7% — субфлагманы от 40 до 65 тысяч рублей, 17% — флагманы от 65 тысяч рублей.
Ценовой сегмент |
Количество устройств |
Средняя оценка зрелости |
Бюджет |
144 |
40,8 |
Средний сегмент |
67 |
44,3 |
Субфлагман |
20 |
46,2 |
Флагман |
47 |
46,0 |
Всего |
278 |
42,9 |
Бюджетные смартфоны действительно получили низкие оценки. Для сравнения мы использовали однофакторный дисперсионный анализ (F=10,504, p=0,000) с поправкой на множественные сравнения. Между средним сегментом, субфлагманами и флагманами значимых различий не обнаружили.
Переход из бюджетной категории дает ощутимый прирост восприятия зрелости, а дальнейшее увеличение цены само по себе уже не гарантирует более высокую оценку ОС.
Доверяй, но проверяй
Чтобы понять, можно ли доверять результатам методики, мы проверили ее надежность. Здесь нам помогли два показателя: альфа Кронбаха и коэффициент расщепления Гуттмана.
Альфа Кронбаха — это коэффициент внутренней согласованности опросника. Он показывает, насколько вопросы связаны между собой и измеряют ли они один общий показатель. В нашем случае альфа Кронбаха составила 0,904 — это высокий результат, подтверждающий, что вопросы согласованно измеряют зрелость устройства.
Коэффициент расщепления Гуттмана — это показатель надежности опросника. Для его расчета вопросы случайным образом делят на две части и сравнивают полученные результаты. Значение 0,908 показывает, что обе половины дают похожие оценки, а значит, методика работает устойчиво и согласованно.
Оба коэффициента принимают значения от 0 до 1. Результат ниже 0,7 обычно считают недостаточным, от 0,7 — приемлемым, от 0,9 — высоким. По обоим критериям методика показала высокую надежность. Затем мы сравнили индекс зрелости с двумя привычными UX-метриками: CSAT, то есть удовлетворенностью, и CES, то есть усилиями пользователя.
Корреляция с CSAT: 0,573.
Корреляция с CES: 0,524.
Обе связи статистически значимы на уровне p = 0,001.
Связь умеренная: показатели обычно меняются в одном направлении, но не совпадают полностью. Это важный результат. Индекс зрелости дополняет CSAT и CES, а не дублирует их, потому что фокусируется именно на качестве работы операционной системы.
Короткая версия: четыре утверждения
Для случаев, когда 16 пунктов слишком много, мы выделили по одному утверждению из каждого компонента. Они сильнее всего связаны с итоговым баллом полной версии:
Мое устройство работает исправно, стабильно и без сбоев (Н+).
На мой взгляд, устройство работает медленно и «тормозит» (П-).
На устройстве не хватает функций для выполнения моих задач (Ф-).
Система на моем устройстве простая: я быстро выполняю все нужные задачи (У+).
Короткая версия подходит, когда нужен один общий показатель и нет задачи разбирать продукт по четырем компонентам.
Где применять методику
Методика подходит для сравнения продукта с конкурентами и оценки его текущей позиции на рынке. Она позволяет отслеживать изменения после релизов и крупных обновлений, а также оценивать отдельные характеристики продукта — надежность, функциональность, производительность и удобство использования. При необходимости опросник можно адаптировать для оценки отдельных компонентов операционной системы или других цифровых продуктов, внеся небольшие изменения в формулировки вопросов.
Опросник помогает перевести расплывчатую жалобу в практичный инструмент со сравнимыми показателями. Скачать можно по ссылке →
Если вы будете пробовать методику на своих продуктах, будем благодарны, если вы поделитесь с нами результатами. Особенно нам интересен опыт использования короткой версии из четырех утверждений: мы пока не проверяли ее отдельно и не сравнивали с UMUX и SUS. Вопросы и наблюдения можно оставить в комментариях к статье или отправить на почту m.kopachevskaya@yadro.com.
А еще хотим поблагодарить коллег из отдела изучения пользовательского опыта YADRO — Алину Новикову и Амира Барзака — за идеи, время и вклад в разработку методики. Такой результат был возможен только благодаря совместной работе.
acc0unt
В 2026 году в России иметь сайт, который не открывается через VPN - это плевок в лицо пользователю.