Skip to content

Author

Muhammad Awais Jadoon

1 paper indexed here

We haven’t gathered this author’s papers yet. Follow them and we’ll fetch their work.

Not the right person? Other researchers publish under this name.

Open access

Machine learning-based random access techniques for massive connectivity

(English) Massive machine-type communication (mMTC) underpins the 5G-and-beyond vision of supporting ultra-dense networks of low-complexity, low-power, battery-operated devices whose traffic characteristics differ significantly from traditional human-type communication, being more sporadic, uncoordinated, and often event-driven. Managing medium access for such a massive number of devices is a central challenge in mMTC. Traditional scheduling or grant-free Random access (RA) approaches often incur excessive signaling overhead, high collision rates, and offer limited adaptability in environments where traffic patterns vary. This necessitates the design of novel medium access schemes that can scale to massive numbers of devices. In this thesis, we employ multi-agent reinforcement learning (MARL) to design distributed grant-free RA policies that accommodate dynamic traffic conditions and provide service to large populations of devices. We first develop a single-channel environment where the devices learn transmission policy using one-bit broadcast feedback and local packet buffer states using the Deep Q-Learning (DQN) algorithm. Although this approach surpasses baseline Exponential Backoff (EB) techniques in terms of throughput and fairness under regular (Poisson) traffic, it relies on a single-agent training framework and does not fully exploit the Centralized Training and Decentralized Execution (CTDE) principle. Recognizing the importance of scalability and effective coordination in large networks, we next adopt advanced MARL algorithms—Value Decomposition Networks (VDN) and QMIX, in which a global Q-value is computed from individual Q-values, thus leveraging global network information during training. To evaluate fairness, we introduce the age of packet (AoP) metric, which quantifies the staleness of untransmitted packets in device buffers. We then extend our models to accommodate bursty and correlated traffic arrivals, demonstrating that the proposed MARL schemes can adapt effectively to sudden device activation or shifting arrival patterns. We also investigate how user identification impacts policy learning and fairness, as devices may dynamically join or leave the network. We show how these design choices can influence fairness and allow devices to leave/join the network. Additionally, we broaden the scope beyond a single channel, incorporating multiple orthogonal resources to highlight the generality of these approaches. Throughout our extensive simulations, all MARL-based methods consistently outperform EB schemes. Our findings underscore the promise of MARL-driven solutions for mMTC and future wireless systems. (Català) El 5G i la seva evolució a nous sistemes d’informació i comunicació contempla la comunicació massiva entre sensors i dispositius màquina (mMTC) com un dels principals casos d’ús. Més enllà de donar suport a xarxes ultradenses de dispositius de baixa complexitat, baix consum i que funcionen amb bateries, les característiques de tràfic de dades difereixen significativament de les comunicacions tradicionals, on la implicació humana és més explícita. Les comunicacions associades a mMTC es caracteritzen per ser molt més esporàdiques, descoordinades i sovint basades en esdeveniments. Gestionar l'accés al medi per a un nombre massiu de dispositius és un dels reptes centrals en mMTC. Els esquemes tradicionals basats en l’assignació prèvia de recursos (scheduling), o bé els enfocaments d'accés aleatori (RA) sense reserva, sovint incorren en senyalització excessiva, altes taxes de col·lisió i ofereixen una adaptabilitat limitada en entorns on els patrons de tràfic varien. Aquestes necessitats requereixen el disseny de nous esquemes d'accés al medi que puguin escalar en nombre de dispositius, fins a valors molt elevats. En aquesta tesi, utilitzem l'aprenentatge per reforç multiagent (MARL) per dissenyar polítiques distribuïdes d’accés aleatori sense reserva prèvia dels recursos, que s'adaptin a les condicions de tràfic de dades dinàmiques i siguin factibles per donar servei de forma massiva. Primer hem desenvolupat un entorn d’aprenentatge automàtic per un sol canal on els dispositius aprenen la política de transmissió mitjançant la retroalimentació d’un bit pel canal de difusió, així com a partir de la memòria intermèdia local (buffer) amb els estats dels paquets, aplicant un algorisme d’aprenentatge de valors Q profund (DQN). Tot i que, sota tràfic regular de Poisson, aquesta solució supera en rendiment de taxa de transmissió i equitat a les tècniques convencionals basades en retrocés exponencial (EB), es basa en un marc d'entrenament d'un sol agent i no aprofita completament el principi d’entrenament central i execució distribuïda (CTDE). Reconeixent la importància de l'escalabilitat i la coordinació efectiva en xarxes grans, hem adoptat algorismes avançats MARL, com ara les xarxes de descomposició de valors (VDN) i QMIX, en els quals es calcula un valor Q global a partir de valors Q individuals, aprofitant així la informació de la xarxa global durant l'entrenament. Per avaluar l'equitat, introduïm la mètrica anomenada edat dels paquets (AoP), que quantifica l'obsolèscencia dels paquets no transmesos en les memòries intermèdies del dispositiu. A continuació, ampliem els nostres models per adaptar-nos a altres models de tràfic amb arribades a ràfegues i correlades, demostrant que els esquemes MARL proposats poden adaptar-se eficaçment a l'activació sobtada del dispositiu o als patrons d'arribada canviants. També investiguem com la identificació dels usuaris afecta l'aprenentatge i l'equitat de les polítiques, ja que els dispositius poden unir-se o sortir dinàmicament de la xarxa. Mostrem com aquestes opcions de disseny poden influir en l'equitat i permetre que els dispositius surtin o s'uneixin a la xarxa. També, hem ampliat l'abast del model més enllà d'un sol canal, incorporant múltiples recursos ortogonals, demostrant la generalització d'aquests enfocaments. Al llarg de les extenses simulacions, s’ha observat com tots els mètodes basats en MARL superen de forma consistent els esquemes EB. Les nostres troballes subratllen el potencial de les solucions basades en MARL per a escenaris mMTC i futurs sistemes sense fils. (Español) El 5G y su evolución a nuevos sistemas de información y comunicación contempla la comunicación masiva entre sensores y dispositivos máquina (mMTC) como uno de los principales casos de uso. Más allá de dar soporte a redes ultradensas de dispositivos de baja complejidad, bajo consumo y que funcionan con baterías, las características de tráfico de los datos difieren significativamente de las comunicaciones tradicionales, donde la implicación humana es más explícita. Las comunicaciones asociadas a mMTC se caracterizan por ser mucho más esporádicas, descoordinadas y a menudo basadas en acontecimientos. Gestionar el acceso al medio para un número masivo de dispositivos es uno de los retos centrales en mMTC. Los esquemas tradicionales basados en la asignación previa de recursos (scheduling), o bien los enfoques de acceso aleatorio (RA) sin reserva, a menudo incurren en señalización excesiva, altas tasas de colisión y ofrecen una adaptabilidad limitada en entornos donde los patrones de tráfico varían. Estas necesidades requieren el diseño de nuevos esquemas de acceso al medio que puedan escalar en número de dispositivos, hasta valores muy elevados. En esta tesis, utilizamos el aprendizaje por refuerzo multiagente (MARL) para diseñar políticas distribuidas de acceso aleatorio sin reserva previa de los recursos, que se adapten a las condiciones de tráfico de datos dinámicos y que sean factibles para dar servicio de forma masiva. Primero hemos desarrollado un entorno de aprendizaje automático para un solo canal donde los dispositivos aprenden la política de transmisión mediante la retroalimentación de un bit por el canal de difusión, así como de la memoria intermedia local (buffer) con los estados de los paquetes, aplicando un algoritmo de red the valores Q profunda (DQN). Aunque, bajo tráfico regular de Poisson, esta solución supera en rendimiento de tasa de transmisión y equidad a las técnicas convencionales basadas en retroceso exponencial (EB), se basa en un marco de entrenamiento de un solo agente y no aprovecha completamente el principio de entrenamiento centralizado y ejecución distribuida (CTDE). Reconociendo la importancia de la escalabilidad y la coordinación efectiva en redes grandes, hemos adoptado algoritmos avanzados MARL, como las redes de descomposición de valores (VDN) y QMIX, en los que se calcula un valor Q global a partir de valores Q individuales, aprovechando así la información de la red global durante el entrenamiento. Para evaluar la equidad, introducimos la métrica llamada edad de los paquetes (AoP), que cuantifica la obsolescencia de los paquetes no transmitidos en las memorias intermedias del dispositivo. A continuación, hemos ampliado los modelos para adaptarnos a otros modelos de tráfico con llegadas a ráfagas y correladas, demostrando que los esquemas MARL propuestos pueden adaptarse eficazmente a la activación repentina del dispositivo o a los patrones de llegada cambiantes. Mostramos cómo la identificación de los usuarios afecta al aprendizaje y la equidad de las políticas, ya que los dispositivos pueden unirse o salir dinámicamente de la red. También, hemos ampliado el alcance del modelo más allá de un solo canal, incorporando múltiples recursos ortogonales, demostrando la generalización de estos enfoques. A lo largo de las extensas simulaciones, se ha observado cómo todos los métodos basados en MARL superan de forma consistente los esquemas EB. Nuestros hallazgos subrayan el potencial de las soluciones basadas en MARL para escenarios mMTC y futuros sistemas inalámbricos.

Muhammad Awais Jadoon · 0 citations

We use cookies to run the site and, with your consent, for analytics and to show ads. See our Cookie Policy.