Alineación de la inteligencia artificial

La alineación de la inteligencia artificial (IA) es un campo de investigación que busca garantizar que los sistemas de IA persigan los objetivos e intereses de sus diseñadores, evitando que un sistema competente actúe de formas no previstas. Este desafío incluye problemas como las "trampas para obtener recompensas", la búsqueda de poder como objetivo instrumental y los objetivos emergentes, que afectan a tecnologías como los robots, los modelos de lenguaje y los vehículos autónomos. El problema fue articulado por primera vez en 1960 por el pionero Norbert Wiener, quien advirtió sobre la necesidad de estar seguros de que el propósito de la máquina sea el que realmente deseamos, y sigue siendo un reto sin resolver en la actualidad. Como parte de la seguridad de la IA, la investigación se centra en aprender valores humanos, desarrollar IA honesta y prevenir comportamientos emergentes, conectándose con campos como la interpretabilidad y la verificación formal. Finalmente, tanto la comunidad investigadora como las Naciones Unidas han exigido soluciones técnicas y políticas, ya que especificar completamente los valores complejos en los algoritmos sigue siendo una tarea extremadamente difícil.