Прогнозирование и управление с использованием моделей временных сегментов

Аннотация
Мы представляем метод обучения динамике сложных нелинейных систем, основанный на глубоких генеративных моделях по временным сегментам состояний и действий. В отличие от моделей динамики, которые оперируют отдельными дискретными временными шагами, мы изучаем распределение будущих траекторий состояний в зависимости от прошлого состояния, прошлого действия и запланированных будущих траекторий действий, а также скрытого априорного распределения траекторий действий. Наш подход основан на сверточных авторегрессионных моделях и вариационных автоэнкодерах. Он позволяет делать стабильные и точные прогнозы на большие горизонты для сложных стохастических систем, эффективно выражая неопределенность и моделируя последствия столкновений, сенсорных шумов и задержек действий. Изученная модель динамики и априорное распределение действий могут быть использованы для сквозной (end-to-end), полностью дифференцируемой оптимизации траекторий и оптимизации политик на основе моделей, которые мы применяем для оценки производительности и эффективности выборки нашего метода.
Авторы
Полный текст статьи читайте на OpenAI
