Skip to content
#edge computing Open access

Sustaining Edge AI training under intermittent power

Oct 2026 · University of Vienna
IoT and Edge/Fog Computing

Abstract

Edge Devices, die in abgelegenen Orten eingesetzt werden, sind zunehmend auf Strom aus erneuerbaren Energien angewiesen, um die lokalen Berechnungen und das Training von KI-Modellen aufrechtzuerhalten. Die durch Energy Harvesting gewonnene Energie ist jedoch von Natur aus unzuverlässig, weshalb die Ausführung von KI-Modellen durch unvorhersehbare Energieausfälle jederzeit unterbrochen werden kann. Daher stellt die Persistenz des Trainingsfortschritts über solche Ausfälle eine grundlegende Herausforderung in Edge Computing Szenarien dar, in denen eine stabile Verbindung zur Cloud nicht gewährleistet oder gänzlich unverfügbar ist. Diese Arbeit untersucht, wie das KI-Training auf Edge Devices aufrechterhalten werden kann, indem die Workloads, bestehend aus dem KI-Modell selbst oder den Trainingsdaten, vor einem Informationsverlust auf benachbarte, aktive Edge Devices migriert werden. Zu diesem Zweck werden 3 verschiedene Migrationsstrategien evaluiert, welche eine reaktive, eine proaktive und eine hybride Strategie umfassen. Die reaktive Strategie basiert auf einem serverzentrierten Heartbeat-Monitoring, welches die Erstellung eines Checkpoints des KI-Modells oder der Trainingsdaten auslöst und diesen bei Bedarf auf einen verfügbaren Partner überträgt. Der proaktive Ansatz hingegen lässt die Edge Devices ihre eigene Energieversorgung überwachen. Diese Devices verwenden einen definierten Schwellenwert in der Stromzufuhr als Auslöser, um eine vollständige Migration des KI-Modells oder der gesamten Datenmenge einzuleiten. Die hybride Strategie hingegen kombiniert schließlich beide vorangegangenen Mechanismen indem die Edge Devices ihre eigene Energieversorgung überwachen. Sobald der Schwellenwert unterschritten wird, wird ein Checkpoint erstellt und ein Partner mit ausreichender Rechenkapazität ausgewählt, welcher den Checkpoint übernimmt und die Ausführung fortsetzt. Dabei setzt die hybride Strategie auf eine uneingeschränkte Partnerwahl, variable KI-Modell Limits pro Gerät und dynamische Stromschwellenwerte. Ergänzend wird untersucht, welchen Einfluss Optimierungsmaßnahmen wie Load Balancing und die Erweiterung der Edge Devices um eine Batterie auf die Gesamtperformance haben. Die Evaluierung dieser Arbeit erfolgt mithilfe einer Simulation, welche auf real gemessenen Solar- und Winddaten basiert. Diese Daten stammen aus dem Datensatz "UK Power Networks Photovoltaic Solar Panel Energy Generation" von der Regionalverwaltung des Großraums Londons [Aut]. Der Datensatz umfasst 69.480 Einträge mit 38 Attributen und wurde an 5 verschiedenen Messstationen in London über einen Zeitraum von November 2013 bis zum November 2014 erhoben. Da die Simulation auf empirischen Messdaten und nicht auf synthetischen Daten beruht, bildet der experimentelle Aufbau die Gewinnung von Solar- und Windenergie realitätsnah ab. Die Ergebnisse der Experimente zeigen, dass die reaktive Strategie nur bei einer großen Anzahl an Partnern eine hohe Zuverlässigkeit erreicht. Grundsätzlich ist die proaktive Strategie dadurch eingeschränkt, dass Schwankungen in der Stromversorgung nicht zuverlässig von tatsächlichen Stromausfällen unterschieden werden können, weshalb häufig falsch-positive Migrationen eingeleitet werden. Dem gegenüber erzielt die hybride Strategie, sowohl für die Datenmigration als auch für die Migration von KI-Modellen, die höchste Migrationserfolgsrate (MSR) von etwa 99.4% im Durchschnitt. Darüber hinaus steigert das Load Balancing die MSR der reaktiven Strategie auf 96% und reduziert die Migrationshäufigkeit der proaktiven Strategie um 39% bis 45%. Die Einführung einer kleinen Batterie verringert die Migrationshäufigkeit über alle 3 Strategien hinweg, während die dynamischen Stromschwellenwerte der hybriden Strategie einen gegenteiligen Effekt auf das Migrationsverhalten aufweisen. Hinsichtlich der Kontinuität der KI-Modellausführung, gemessen am kumulativen Program Counter aller 9 KI-Modelle, erzielt die hybride Strategie mit einem Wert von 8932 von maximal 9000 die höchste Leistung. Die reaktive Strategie erreicht maximal einen Program Counter von 8776, während die proaktive Strategie maximal 4598 erzielt. Die Erweiterung der Geräte um eine kleine Batterie verbessert den Program Counter bei der reaktiven und proaktiven Strategie erheblich und versetzt die hybride Strategie in die Lage, die vollständige Ausführung aller KI-Modelle über die gesamte Simulation hinweg zu gewährleisten. [Aut] Greater London Authority. Photovoltaic (pv) solar panel energy generation data. Accessed: 2024-11-13.

View source

Similar papers

#computer vision Review Sep 2017

Agile Software Development Methods: Review and Analysis

This publication proposes a definition and a classification of agile software development approaches and analyses ten software development methods that can be characterized as being "agile" against the defined criterion.

P. Abrahamsson, O. Salo, Jussi Ronkainen et al. · 727 citations · ⚡54
#computer vision Jun 2008

The impact of agile practices on communication in software development

The study shows that agile practices improve both informal and formal communication, but indicates that, in larger development situations involving multiple external stakeholders, a mismatch of adequate communication mechanisms can sometimes even hinder the communication.

M. Pikkarainen, Jukka Haikara, O. Salo et al. · 401 citations · ⚡48
#machine learning Review Open access Oct 2014

Software development in startup companies: A systematic mapping study

The results indicate that software engineering work practices are chosen opportunistically, adapted and configured to provide value under the constrains imposed by the startup context.

Nicolò Paternoster, Carmine Giardino, M. Unterkalmsteiner et al. · 394 citations · ⚡54

Related blog posts

Microsoft Research Blog Oct 6, 2026

What AI gets wrong and what failure teaches us

Jennifer Neville did not want to go into computer science—but that’s exactly where she landed. Neville discusses the starts and stops that led to her professional sweet spot and her work identifying “surprising failures” making it hard for AI to handle complexity.  The post What AI gets wrong and what failure teaches us appeared first on Microsoft Research.

We use cookies to run the site and, with your consent, for analytics and to show ads. See our Cookie Policy.