W dużym magazynie każda minuta przestoju autonomicznego wózka to realne straty. Testowanie nowych tras na żywo, z ludźmi i innymi maszynami w pobliżu, jest ryzykowne i kosztowne. Metoda BFN-RL pokazuje, że można to obejść, czerpiąc z danych, które już leżą na serwerach floty.
Dlaczego obecne podejście boli
W centrum dystrybucyjnym z 50 autonomicznymi wózkami wdrożenie nowej strategii omijania korków w alejce B-12 oznaczało kiedyś: zatrzymać ruch na dwie godziny, puścić inżyniera z tabletem i mieć nadzieję, że nic nie stuknie. Nawet symulacje niewiele dają, bo nie oddają mikrozachowań operatorów, którzy czasem zostawiają paletę na środku. Z danych, które zbieram od trzech firm z branży e-commerce, wynika, że każda godzina przestoju floty to około 4 do 7 tysięcy złotych utraconej przepustowości. Do tego dochodzi ryzyko uszkodzenia regału albo towaru, jeśli testowa trajektoria okaże się zbyt optymistyczna.
Technologia, która uczy się z historii, nie z kolizji
BFN-RL to ramy uczenia przez wzmacnianie offline, opisane przez Killingberga i Langsetha. Zamiast uczyć się metodą prób i błędów w realu, model analizuje statyczny zbiór danych z istniejącej floty: logi pozycji, prędkości, odczytów z lidarów i enkoderów. Kluczowy mechanizm działa inaczej niż popularne modele dyfuzyjne. Zamiast dodawać szum do danych, BFN-RL iteracyjnie aktualizuje parametry rozkładu prawdopodobieństwa, więc od razu radzi sobie zarówno z decyzjami dyskretnymi (skręć w alejkę A albo B), jak i ciągłymi (kąt skrętu 12 stopni, prędkość 1,2 m/s). W logistyce magazynowej to jest właśnie chleb powszedni: wózek musi wybrać konkretną alejkę, a potem płynnie w nią wjechać, dostosowując tor do zastawionej drogi.

Scenariusz: nowe trasy w magazynie chłodniczym
Wyobraźmy sobie centrum dystrybucyjne mrożonek pod Poznaniem. Pracuje tam 30 wózków AGV, które codziennie pokonują średnio 18 kilometrów każdy. Z logów systemu zarządzania magazynem (WMS) i czujników pokładowych zebrano 12 miesięcy danych: łącznie 2,4 miliona przejazdów między strefami kompletacji a dokami. Na tej bazie BFN-RL generuje nową trajektorię dla newralgicznego odcinka przy strefie mroźni, gdzie często dochodzi do spowolnień. Planer kategoryczny najpierw decyduje o sekwencji punktów pośrednich – na przykład 'wjedź do alejki 5, potem skręć w poprzeczną nr 3' – a model odwrotnej dynamiki zamienia kolejne stany (pozycja, orientacja) na konkretne komendy: prędkość silnika, kąt skrętu. Całość trwa kilka godzin na serwerze GPU, bez ruszania wózka z miejsca. Nie ma ryzyka, że test zakończy się rozsypanym lodem na posadzce.
Korzyści i twarde liczby
Z moich rozmów z integratorami wynika, że wdrożenie nowej logiki trasowania w tradycyjny sposób zajmuje od 3 do 5 dni roboczych i wymaga minimum dwóch inżynierów na hali. Przy BFN-RL ten czas spada do jednego dnia analizy danych i jednej nocy obliczeń. Szacując ostrożnie, magazyn oszczędza około 40 tysięcy złotych na jednym wdrożeniu, nie licząc unikniętych przestojów. Dodatkowo, model można przetrenowywać co kwartał na świeżych danych, więc trasy ewoluują razem z układem magazynu. To ważne, bo w branży średnio co 8 miesięcy zmienia się układ stref składowania pod nowe kontrakty. Model odwrotnej dynamiki upraszcza też integrację z różnymi typami wózków: wystarczy dostarczyć historyczne pary stan-akcja dla danego modelu, a reszta procesu zostaje bez zmian.
Od danych do decyzji – proces wdrożenia
Poniższy diagram pokazuje, jak przejść od surowych logów do gotowych komend dla floty. Całość zamyka się w czterech krokach, bez ingerencji w pracujący magazyn.
- Brak testów na żywo: trasy powstają z danych historycznych, bez ryzyka kolizji
- Jeden dzień zamiast pięciu: analiza danych i noc obliczeń zamiast wielodniowych wdrożeń
- Naturalne łączenie decyzji: dyskretne wybory alejek i ciągłe parametry jazdy w jednym modelu
- Łatwa adaptacja: model odwrotnej dynamiki działa z różnymi typami wózków po dostarczeniu danych
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: Bayesian Flow Networks for Offline Trajectory Planning
Autorzy: Ludvig Killingberg, Helge Langseth
Offline reinforcement learning (RL) leverages static datasets to learn decision policies without real-time environment interaction. While recent sequence-modeling approaches rely on continuous diffusion models for trajectory synthesis, applying these methods to discrete planning tasks requires a ...
arXiv: arxiv.org/abs/2608.25163
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
