En las sociedades abiertas, como los sistemas multi-agente, es importante que la coordinación entre los diversos actores se logre de manera eficiente.
Tradicionalmente, la preferencia por adoptar las opciones más vistas (la opción mayoritaria) ha dominado la investigación de convenciones en el surgimiento de múltiples agentes. Pero se ha introducido un nuevo tipo de interacción, basado en la fuerza, donde la fuerza no está definida a priori, sino que evoluciona de forma dinámica. Si se compara la opción mayoritaria de actualización contra la fuerza de las interacciones en tipo de encuentros, normas de interacción y topologías de red se demuestra que las interacciones basadas en la fuerza son significativamente más eficientes para la toma de decisiones en grupo.
Shoham y Tennenholtz en 1992 han defendido que en sistemas multi-agente tienen que ponerse de acuerdo sobre normas comunes para disminuir el número de conflictos y promover el comportamiento cooperativo. Estas normas tienen la forma de convenios que los agentes comparten para favorecer la coordinación.
Un grupo de agentes homogéneos tiene que decidir la adopción de una estrategia de comportamiento de un conjunto dado. Lo importante es que todo el mundo adoptó la misma estrategia.
En 1995 Kittock presentó grafos de interacción con el fin de establecer restricciones a las interacciones e hizo experimentos con la actualización del HCR (“mayor acumulación de recompensas”, la norma individual de actualización más eficiente). Esta norma se basa en la adopción de la estrategia que se observó con mayor frecuencia en otros agentes en las últimas m interacciones, y permanecer con su estrategia actual, de lo contrario, en caso de empate no cambian. La memoria se utiliza para registrar las estrategias observadas durante las interacciones pasadas. Un agente actualiza su memoria después de observar la estrategia de sus socios y luego decide cambiar de una nueva estrategia sólo en el caso de que esta sea más frecuente que la actual. Basado en sus experimentos con grafos regulares y completamente conectados, se conjeturó que la eficiencia depende del diámetro del grafo. En lo que respecta al número de interacciones necesarias para lograr el consenso, Kittock observó una variación con el número de agentes de O (N3) para grafos regulares y O (nlogn) para los completamente conectados.
En 2005 Urbano y Coelho presentan una nueva norma para la estrategia de actualización, llamada “reclutamiento basado en la fuerza con refuerzo” (RFR). Esta regla consiste en que los agentes se caracterizan por dos atributos: la estrategia y la fuerza. Estos atributos pueden ser observados durante los encuentros. Durante un diálogo con dos agentes, uno es el agente observación y el otro es el observado. El agente observación "pelea" con su socio. Compara su fuerza con la fuerza del otro agente. Si el agente observa que es el más fuerte, o si tienen idéntica fuerza, se suelta la lucha, de lo contrario será el ganador. El comportamiento del ganador es:
• si tienen la misma estrategia su fuerza se ve reforzada por una unidad, de lo contrario
• no hace nada.
El comportamiento del perdedor es el siguiente:
• imita tanto la estrategia y la fuerza en caso de que tengan diferentes corrientes de estrategia, de lo contrario
• imita la fuerza del agente ganador e incrementa su fuerza en 1 unidad. Los agentes más fuerte reclutar agentes más débiles.
En conclusión esta regla mostró más rápido la convergencia que la HCR. En RFR, los agentes tienen diferente poder para influir en otros, pero su fuerza no está definida a priori en una red, sino que evoluciona de forma dinámica a lo largo de las interacciones. Los Agentes que se presentan /someten a agentes más fuertes, copian sus estrategias, pero también heredan su fuerza. En (Urbano et al. 2008) se comparó el reclutamiento basado en Fuerza contra el HCR para diferente topologías de grafos y RFR demuestra ser más eficiente para Totalmente conectado, Smallworld, Libre de escala, los regulares y redes de azar.
Tradicionalmente, la preferencia por adoptar las opciones más vistas (la opción mayoritaria) ha dominado la investigación de convenciones en el surgimiento de múltiples agentes. Pero se ha introducido un nuevo tipo de interacción, basado en la fuerza, donde la fuerza no está definida a priori, sino que evoluciona de forma dinámica. Si se compara la opción mayoritaria de actualización contra la fuerza de las interacciones en tipo de encuentros, normas de interacción y topologías de red se demuestra que las interacciones basadas en la fuerza son significativamente más eficientes para la toma de decisiones en grupo.
Shoham y Tennenholtz en 1992 han defendido que en sistemas multi-agente tienen que ponerse de acuerdo sobre normas comunes para disminuir el número de conflictos y promover el comportamiento cooperativo. Estas normas tienen la forma de convenios que los agentes comparten para favorecer la coordinación.
Un grupo de agentes homogéneos tiene que decidir la adopción de una estrategia de comportamiento de un conjunto dado. Lo importante es que todo el mundo adoptó la misma estrategia.
En 1995 Kittock presentó grafos de interacción con el fin de establecer restricciones a las interacciones e hizo experimentos con la actualización del HCR (“mayor acumulación de recompensas”, la norma individual de actualización más eficiente). Esta norma se basa en la adopción de la estrategia que se observó con mayor frecuencia en otros agentes en las últimas m interacciones, y permanecer con su estrategia actual, de lo contrario, en caso de empate no cambian. La memoria se utiliza para registrar las estrategias observadas durante las interacciones pasadas. Un agente actualiza su memoria después de observar la estrategia de sus socios y luego decide cambiar de una nueva estrategia sólo en el caso de que esta sea más frecuente que la actual. Basado en sus experimentos con grafos regulares y completamente conectados, se conjeturó que la eficiencia depende del diámetro del grafo. En lo que respecta al número de interacciones necesarias para lograr el consenso, Kittock observó una variación con el número de agentes de O (N3) para grafos regulares y O (nlogn) para los completamente conectados.
En 2005 Urbano y Coelho presentan una nueva norma para la estrategia de actualización, llamada “reclutamiento basado en la fuerza con refuerzo” (RFR). Esta regla consiste en que los agentes se caracterizan por dos atributos: la estrategia y la fuerza. Estos atributos pueden ser observados durante los encuentros. Durante un diálogo con dos agentes, uno es el agente observación y el otro es el observado. El agente observación "pelea" con su socio. Compara su fuerza con la fuerza del otro agente. Si el agente observa que es el más fuerte, o si tienen idéntica fuerza, se suelta la lucha, de lo contrario será el ganador. El comportamiento del ganador es:
• si tienen la misma estrategia su fuerza se ve reforzada por una unidad, de lo contrario
• no hace nada.
El comportamiento del perdedor es el siguiente:
• imita tanto la estrategia y la fuerza en caso de que tengan diferentes corrientes de estrategia, de lo contrario
• imita la fuerza del agente ganador e incrementa su fuerza en 1 unidad. Los agentes más fuerte reclutar agentes más débiles.
En conclusión esta regla mostró más rápido la convergencia que la HCR. En RFR, los agentes tienen diferente poder para influir en otros, pero su fuerza no está definida a priori en una red, sino que evoluciona de forma dinámica a lo largo de las interacciones. Los Agentes que se presentan /someten a agentes más fuertes, copian sus estrategias, pero también heredan su fuerza. En (Urbano et al. 2008) se comparó el reclutamiento basado en Fuerza contra el HCR para diferente topologías de grafos y RFR demuestra ser más eficiente para Totalmente conectado, Smallworld, Libre de escala, los regulares y redes de azar.
No hay comentarios:
Publicar un comentario