Skip to content

Generalized Coordinated Learning for Radio Resource Management in Dense D2D Networks

2026 · IEEE Transactions on Communications · Vol 74, pp. 10540-10555 · 0 citations · 56 references
Computer Science

Abstract

Dense device-to-device (D2D) communication networks with a huge number of directly communicating devices necessitate an efficient radio resource management to maximize network performance. To this end, we first propose a novel intelligent channel reuse based on deep deterministic policy gradient (DDPG) to maximize efficiency of the radio resource usage. In the real-world, any channel reuse inevitably imposes additional interference requiring to i) allocate properly transmission power at individual reused channels and ii) knowledge of a high number of interference channels among devices. Such practical challenges are addressed in existing literature commonly via deep neural networks (DNNs). However, simple coexistence of multiple naturally sub-optimal machine learning models, such as DNN for channel quality prediction, DNN for transmission power allocation, and DDPG for channel reuse leads to a problem with a propagation of inevitable small errors in the prediction by individual models. Consequently, even a small error in the decision taken by one model can mislead decisions taken by other models. To solve this challenge, we further propose a low-complexity Generalized Coordinated Learning (GCL) allowing a coordination of multiple light-weight machine learning models. The GCL employs feedback loops among machine learning models to jointly optimize multiple radio resource management parameters in a coordinated way with awareness of decisions taken by other models. Simulation results demonstrate that the proposed GCL reaches near-optimal performance even in dense D2D networks and improves sum capacity and ratio of users meeting their required communication capacity by up to 69.6% and 22.1%, respectively, compared to state-of-the-art works.

View source

Similar papers

Aug 2026

Next-gen D2D communication: efficient resource allocation with clustered combinatorial matching

A maximum matching algorithm for channel allocation with a faster convergence rate that divides the entire set of cellular users and D2D groups into overlapping clusters based on channel gains and utilizes the Kuhn-Munkres algorithm for the best channel allocation to the D2D groups within the same cluster.

Rajesh K. Gupta, Sudeep Tanwar, Sudhanshu Tyagi · 0 citations
Open access Aug 2026

FFR-based radio resource allocation for RIS-aided D2D communication in multicell cellular network

This paper explores the application of a fractional frequency reuse (FFR) strategy purposed for networks that integrate both D2D and RIS technologies in multicell cellular network scenarios, and demonstrates its effectiveness in improving network reliability and efficiency.

Misfa Susanto, Soraida Sabella, H. Fitriawan et al. · 0 citations
Conference Jul 2026

Deep Learning-Based Resource Allocation for Visible Light Communication Networks

To fulfill the ultra-low latency and high-reliability requirements of sixth-generation (6G) hyperconnectivity, this paper proposes VLC-Net, a supervised deep learning framework for real-time resource allocation in multicell visible light communication (VLC) networks employing non-orthogonal multiple access (NOMA). A feedforward deep neural network (DNN) with a Bayesian-optimized architecture was trained using twenty thousand near-optimal power allocation labels generated by a fairness-centric constrained genetic algorithm (CGA). Extensive Monte Carlo simulations for networks with four, six, eight, and ten users show that VLC-Net achieves an inference time as low as 2.65 milliseconds for ten users and an average inference time of 13.71 milliseconds across all evaluated user densities. This performance represents an approximately 388 times speedup over iterative evolutionary solvers. Furthermore, the proposed model improves Jain’s fairness index by 66 percent compared with the greedy Water Filling approach while maintaining an energy efficiency of 10.87 megabits per second per watt under high-interference conditions with ten users. Paired t tests yield probability values below 0.05 for all evaluated user densities, confirming statistically significant performance differences. These results demonstrate that VLC-Net offers a robust, scalable, and low-latency solution for practical intelligent power management in future dense indoor optical wireless network deployments.

Marcelia Chintya Hartakaadi, Aminah Indahsari Marsuki, Intan Nisa Bani et al. · 0 citations
Open access Aug 2026

Energy-Efficient Cooperative Data Offloading in Cellular Networks Using Reinforcement Learning

This research is among the first to employ MARL to this extent, and it offers an end-to-end solution that combines cellular, Wi-Fi, and device-to-device (D2D) communications and considers practical network environments like user mobility and channel conditions.

Nabeel Abdolrazagh Yaseen Alrashedi, Rasool Sadeghi, Wael Hussein Zayer Al-Lamy et al. · 0 citations
Open access Aug 2026

DEEP REINFORCEMENT LEARNING-BASED DYNAMIC SPECTRUM ACCESS FOR 6G HETEROGENEOUS COGNITIVE RADIO NETWORKS

A Deep Reinforcement Learning (DRL)-based framework for dynamic spectrum access in 6G heterogeneous Cognitive Radio Networks (Het-CRNs), wherein secondary users learn optimal channel selection policies through direct interaction with the radio environment, without requiring explicit statistical channel models is proposed.

Naadir Kamal, R. Kumar · 0 citations
Open access

Machine learning-based random access techniques for massive connectivity

(English) Massive machine-type communication (mMTC) underpins the 5G-and-beyond vision of supporting ultra-dense networks of low-complexity, low-power, battery-operated devices whose traffic characteristics differ significantly from traditional human-type communication, being more sporadic, uncoordinated, and often event-driven. Managing medium access for such a massive number of devices is a central challenge in mMTC. Traditional scheduling or grant-free Random access (RA) approaches often incur excessive signaling overhead, high collision rates, and offer limited adaptability in environments where traffic patterns vary. This necessitates the design of novel medium access schemes that can scale to massive numbers of devices. In this thesis, we employ multi-agent reinforcement learning (MARL) to design distributed grant-free RA policies that accommodate dynamic traffic conditions and provide service to large populations of devices. We first develop a single-channel environment where the devices learn transmission policy using one-bit broadcast feedback and local packet buffer states using the Deep Q-Learning (DQN) algorithm. Although this approach surpasses baseline Exponential Backoff (EB) techniques in terms of throughput and fairness under regular (Poisson) traffic, it relies on a single-agent training framework and does not fully exploit the Centralized Training and Decentralized Execution (CTDE) principle. Recognizing the importance of scalability and effective coordination in large networks, we next adopt advanced MARL algorithms—Value Decomposition Networks (VDN) and QMIX, in which a global Q-value is computed from individual Q-values, thus leveraging global network information during training. To evaluate fairness, we introduce the age of packet (AoP) metric, which quantifies the staleness of untransmitted packets in device buffers. We then extend our models to accommodate bursty and correlated traffic arrivals, demonstrating that the proposed MARL schemes can adapt effectively to sudden device activation or shifting arrival patterns. We also investigate how user identification impacts policy learning and fairness, as devices may dynamically join or leave the network. We show how these design choices can influence fairness and allow devices to leave/join the network. Additionally, we broaden the scope beyond a single channel, incorporating multiple orthogonal resources to highlight the generality of these approaches. Throughout our extensive simulations, all MARL-based methods consistently outperform EB schemes. Our findings underscore the promise of MARL-driven solutions for mMTC and future wireless systems. (Català) El 5G i la seva evolució a nous sistemes d’informació i comunicació contempla la comunicació massiva entre sensors i dispositius màquina (mMTC) com un dels principals casos d’ús. Més enllà de donar suport a xarxes ultradenses de dispositius de baixa complexitat, baix consum i que funcionen amb bateries, les característiques de tràfic de dades difereixen significativament de les comunicacions tradicionals, on la implicació humana és més explícita. Les comunicacions associades a mMTC es caracteritzen per ser molt més esporàdiques, descoordinades i sovint basades en esdeveniments. Gestionar l'accés al medi per a un nombre massiu de dispositius és un dels reptes centrals en mMTC. Els esquemes tradicionals basats en l’assignació prèvia de recursos (scheduling), o bé els enfocaments d'accés aleatori (RA) sense reserva, sovint incorren en senyalització excessiva, altes taxes de col·lisió i ofereixen una adaptabilitat limitada en entorns on els patrons de tràfic varien. Aquestes necessitats requereixen el disseny de nous esquemes d'accés al medi que puguin escalar en nombre de dispositius, fins a valors molt elevats. En aquesta tesi, utilitzem l'aprenentatge per reforç multiagent (MARL) per dissenyar polítiques distribuïdes d’accés aleatori sense reserva prèvia dels recursos, que s'adaptin a les condicions de tràfic de dades dinàmiques i siguin factibles per donar servei de forma massiva. Primer hem desenvolupat un entorn d’aprenentatge automàtic per un sol canal on els dispositius aprenen la política de transmissió mitjançant la retroalimentació d’un bit pel canal de difusió, així com a partir de la memòria intermèdia local (buffer) amb els estats dels paquets, aplicant un algorisme d’aprenentatge de valors Q profund (DQN). Tot i que, sota tràfic regular de Poisson, aquesta solució supera en rendiment de taxa de transmissió i equitat a les tècniques convencionals basades en retrocés exponencial (EB), es basa en un marc d'entrenament d'un sol agent i no aprofita completament el principi d’entrenament central i execució distribuïda (CTDE). Reconeixent la importància de l'escalabilitat i la coordinació efectiva en xarxes grans, hem adoptat algorismes avançats MARL, com ara les xarxes de descomposició de valors (VDN) i QMIX, en els quals es calcula un valor Q global a partir de valors Q individuals, aprofitant així la informació de la xarxa global durant l'entrenament. Per avaluar l'equitat, introduïm la mètrica anomenada edat dels paquets (AoP), que quantifica l'obsolèscencia dels paquets no transmesos en les memòries intermèdies del dispositiu. A continuació, ampliem els nostres models per adaptar-nos a altres models de tràfic amb arribades a ràfegues i correlades, demostrant que els esquemes MARL proposats poden adaptar-se eficaçment a l'activació sobtada del dispositiu o als patrons d'arribada canviants. També investiguem com la identificació dels usuaris afecta l'aprenentatge i l'equitat de les polítiques, ja que els dispositius poden unir-se o sortir dinàmicament de la xarxa. Mostrem com aquestes opcions de disseny poden influir en l'equitat i permetre que els dispositius surtin o s'uneixin a la xarxa. També, hem ampliat l'abast del model més enllà d'un sol canal, incorporant múltiples recursos ortogonals, demostrant la generalització d'aquests enfocaments. Al llarg de les extenses simulacions, s’ha observat com tots els mètodes basats en MARL superen de forma consistent els esquemes EB. Les nostres troballes subratllen el potencial de les solucions basades en MARL per a escenaris mMTC i futurs sistemes sense fils. (Español) El 5G y su evolución a nuevos sistemas de información y comunicación contempla la comunicación masiva entre sensores y dispositivos máquina (mMTC) como uno de los principales casos de uso. Más allá de dar soporte a redes ultradensas de dispositivos de baja complejidad, bajo consumo y que funcionan con baterías, las características de tráfico de los datos difieren significativamente de las comunicaciones tradicionales, donde la implicación humana es más explícita. Las comunicaciones asociadas a mMTC se caracterizan por ser mucho más esporádicas, descoordinadas y a menudo basadas en acontecimientos. Gestionar el acceso al medio para un número masivo de dispositivos es uno de los retos centrales en mMTC. Los esquemas tradicionales basados en la asignación previa de recursos (scheduling), o bien los enfoques de acceso aleatorio (RA) sin reserva, a menudo incurren en señalización excesiva, altas tasas de colisión y ofrecen una adaptabilidad limitada en entornos donde los patrones de tráfico varían. Estas necesidades requieren el diseño de nuevos esquemas de acceso al medio que puedan escalar en número de dispositivos, hasta valores muy elevados. En esta tesis, utilizamos el aprendizaje por refuerzo multiagente (MARL) para diseñar políticas distribuidas de acceso aleatorio sin reserva previa de los recursos, que se adapten a las condiciones de tráfico de datos dinámicos y que sean factibles para dar servicio de forma masiva. Primero hemos desarrollado un entorno de aprendizaje automático para un solo canal donde los dispositivos aprenden la política de transmisión mediante la retroalimentación de un bit por el canal de difusión, así como de la memoria intermedia local (buffer) con los estados de los paquetes, aplicando un algoritmo de red the valores Q profunda (DQN). Aunque, bajo tráfico regular de Poisson, esta solución supera en rendimiento de tasa de transmisión y equidad a las técnicas convencionales basadas en retroceso exponencial (EB), se basa en un marco de entrenamiento de un solo agente y no aprovecha completamente el principio de entrenamiento centralizado y ejecución distribuida (CTDE). Reconociendo la importancia de la escalabilidad y la coordinación efectiva en redes grandes, hemos adoptado algoritmos avanzados MARL, como las redes de descomposición de valores (VDN) y QMIX, en los que se calcula un valor Q global a partir de valores Q individuales, aprovechando así la información de la red global durante el entrenamiento. Para evaluar la equidad, introducimos la métrica llamada edad de los paquetes (AoP), que cuantifica la obsolescencia de los paquetes no transmitidos en las memorias intermedias del dispositivo. A continuación, hemos ampliado los modelos para adaptarnos a otros modelos de tráfico con llegadas a ráfagas y correladas, demostrando que los esquemas MARL propuestos pueden adaptarse eficazmente a la activación repentina del dispositivo o a los patrones de llegada cambiantes. Mostramos cómo la identificación de los usuarios afecta al aprendizaje y la equidad de las políticas, ya que los dispositivos pueden unirse o salir dinámicamente de la red. También, hemos ampliado el alcance del modelo más allá de un solo canal, incorporando múltiples recursos ortogonales, demostrando la generalización de estos enfoques. A lo largo de las extensas simulaciones, se ha observado cómo todos los métodos basados en MARL superan de forma consistente los esquemas EB. Nuestros hallazgos subrayan el potencial de las soluciones basadas en MARL para escenarios mMTC y futuros sistemas inalámbricos.

Muhammad Awais Jadoon · 0 citations

We use cookies to run the site and, with your consent, for analytics and to show ads. See our Cookie Policy.