Encuesta: SUS (System Usability Scale)

EvaluacióncuantitativoPrincipiante

TL;DR

La Escala de Usabilidad del Sistema (SUS) es una herramienta estandarizada de encuesta utilizada para medir la usabilidad percibida de un sistema. Fue publicada por John Brooke en 1996 como una escala "rápida y sucia" (quick and dirty), lo que significa que es una herramienta de bajo costo y fácil administración, pero efectiva.

Descripción detallada

A pesar de su descripción original como una herramienta rápida, la SUS ha demostrado ser robusta y fiable: en comparaciones con otros cuestionarios de usabilidad suele entregar los resultados más consistentes. Brooke construyó la escala sobre una idea precisa de usabilidad que, según él mismo señala, se refleja en el entonces borrador de la norma internacional ISO 9241-11: la usabilidad no es una propiedad del producto sino de su contexto de uso, y un mismo sistema puede puntuar distinto con otro tipo de usuario o ante otra tarea. De las tres clases de medida que esa norma enumera (efectividad, eficiencia y satisfacción), la SUS cubre la última.

El puntaje se lee contra un punto de comparación, no en abstracto. El promedio de referencia más citado está en torno a 68 (Sauro, 2011), calculado sobre un gran número de estudios de usabilidad. Bangor, Kortum y Miller (2008) midieron por su parte un promedio de 70,1 sobre 2.324 encuestas de su propio corpus, y de 69,7 al promediar por estudio: las dos cifras acotan el mismo orden de magnitud, y cuál se use importa menos que contra qué se compara. Por encima de ese rango la usabilidad percibida del producto queda sobre el promedio, y por debajo, bajo el promedio. La comparación solo se sostiene si el estudio de referencia es comparable en tareas y en perfil de participante.

El cálculo del puntaje sigue siempre el mismo procedimiento:

  1. En los ítems impares (1, 3, 5, 7, 9), se resta 1 a la respuesta del participante.
  2. En los ítems pares (2, 4, 6, 8, 10), se resta la respuesta del participante a 5.
  3. Se suman los diez resultados: el total va de 0 a 40.
  4. Se multiplica esa suma por 2,5 para llevarla a la escala de 0 a 100.

Objetivo principal

El objetivo principal de la SUS es obtener una medición cuantitativa de la satisfacción subjetiva del usuario con el sistema o producto.

Casos de uso

Rediseños con una versión anterior que sirva de línea baseComparativa entre versiones de un mismo productoBenchmark contra el promedio de referencia de la industriaPrototipos y productos ya en producciónInterfaces no gráficas: telefonía y respuesta de voz interactiva

Cuándo usarla

Inmediatamente después de que el participante termina las tareas, antes de cualquier conversación sobre la sesión.

Nivel de esfuerzo

Bajo

Número de usuarios recomendado

12-14 participantes

Ventajas

  • Rapidez de aplicación: Diez preguntas y unos dos minutos de respuesta: cabe al final de una sesión sin alargarla.
  • Un número comparable: Entrega un puntaje único de 0 a 100, comparable entre productos y entre versiones del mismo producto.
  • Eficiencia en muestras pequeñas: Mantiene una consistencia razonable con muestras del orden de 12 a 14 participantes (Tullis y Stetson, 2004).
  • Enunciados alternados: Alterna afirmaciones positivas y negativas, lo que dificulta responder en piloto automático.
  • Gratuita y ya traducida: Es de uso libre (citando la fuente) y está traducida y validada a varios idiomas, así que no hay que construir el instrumento.

Desventajas

  • No es diagnóstica: Entrega un puntaje global: dice que algo anda mal, no qué.
  • No es un porcentaje: Un 68 no significa que el 68 % de las tareas se completó, y esa lectura es el malentendido más frecuente.
  • Mide percepción declarada: Lo que la persona responde sobre el sistema no siempre coincide con el comportamiento que se observó.
  • Intervalos anchos con muestras chicas: Diferencias de pocos puntos entre versiones no son concluyentes.
  • No reemplaza al análisis cualitativo: El número no explica su propia causa.

Cuándo usar

  • Al cerrar una prueba de usabilidad, para poner un número a la experiencia observada
  • Para comparar la usabilidad percibida de dos versiones o contra un punto de referencia
  • Para seguir la misma pantalla en el tiempo y ver si una intervención movió la aguja

Métricas

  • Puntaje SUS de 0 a 100
  • Número de participantes de la medición
  • Comparación contra el promedio de referencia de la industria (en torno a 68)
  • Rango de aceptabilidad: no aceptable bajo 50, marginal entre 50 y 70, aceptable sobre 70 (Bangor, Kortum y Miller, 2008)
  • Diferencia entre versiones, con su margen de error

Ejemplo práctico

Tras completar cinco tareas en un portal de pagos, cada participante responde los diez ítems y el promedio del grupo se compara con el de la versión anterior.

Metodologías relacionadas

Recursos Relacionados

Herramienta gratuita de UXR — Consultoría de UX Research en Chile

Última actualización: