Традиційні системи прийняття рішень щодо автомобілів часто покладаються на модульну конструкцію. Від сприйняття навколишнього середовища планування прийняття рішень до контролю транспортних засобів кожна підсистема працює незалежно та спільно контролює роботу транспортного засобу. У складних сценаріях руху ця ієрархічна архітектура схильна до таких проблем, як кумулятивні помилки, втрата інформації та недостатня ефективність роботи в режимі реального часу. Великі моделі поступово змінюють цю ситуацію з їх масовими параметрами, перехресними можливостями обробки даних та парадигмами навчання в кінці. Він може не лише досягти ефективного злиття даних про багатосенсору на рівні сприйняття, але й планувати більш розумні стратегії водіння транспортних засобів через глибоке семантичне розуміння та логічні міркування на рівні прийняття рішень, тим самим підвищуючи загальну безпеку та надійність.
Переваги великих моделей в автономному водінні
Процес розробки самої технології автономного водіння пройшов через кілька етапів, від раннього руху за допомогою поступового переходу до повністю автономного водіння. Ранні системи здебільшого покладалися на просте виявлення об'єктів та контроль правил. З розвитком глибокого навчання прийняття таких методів, як CNN, RNN і навіть GAN, постійно покращує можливості сприйняття навколишнього середовища та прийняття рішень. Більше того, технологія, що поєднує в собі BEV (пташине око) представлення та трансформатор, певною мірою, компенсував недоліки традиційних методів у просторово-часовому моделюванні. Можна сказати, що введення великих моделей принципово переробляє загальну архітектуру автономних систем водіння, закладаючи міцну основу для комерціалізації рівня L3, L4 та навіть L5 в майбутньому.
Модельна архітектура, заснована на трансформаторі, зазвичай приймає механізм самовдосконалення, який може зафіксувати залежності на великі відстані, тим самим значно покращуючи глобальність та точність обробки інформації. Завдяки підходу до налаштування перед тренуванням, модель попередньо навчається на масштабних не маркованих даних, а потім тонко налаштована на конкретні завдання автономного водіння. Це не тільки зменшує залежність від великої кількості мічених даних, але й дозволяє моделі мати хороші можливості міграції поперечних доменів. Мультимодальні великі моделі можуть одночасно обробляти різні форми даних, такі як зображення, точкові хмари та радіолокаційні дані, досягнення стрибка від "бачення" до "розуміння" та наділення автономних систем водіння з когнітивними можливостями, подібними до таких людей.
Конкретне застосування великих моделей в автономному водінні
У автономних системах водіння застосування великих моделей в основному відображається на багатьох аспектах, таких як сприйняття навколишнього середовища, прийняття рішень та планування та контроль транспортних засобів. З точки зору сприйняття навколишнього середовища, традиційні системи в основному покладаються на дані одного датчика для виявлення цілі та семантичної сегментації. Однак через обмеження освітлення, погоди та самих датчиків у них часто виникають труднощі з складними сценаріями. Завдяки багатомодальній технології синтезу даних, великі моделі можуть інтегрувати різні дані, такі як камери, ліди, міліметрові радари та карти з високою точністю для формування більш багатого та точного представлення навколишнього середовища. Наприклад, модель візуальної мови (VLA) може одночасно витягувати візуальну інформацію та семантичну інформацію на зображенні та демонструє надзвичайно високу точність у виявленні перешкод, прогнозуванні поведінки пішоходів та судження про дорожні умови. Після того, як інформація про декілька датчиків глибоко зростає великою моделлю, не тільки надійність виявлення цілі посилюється, але й прогнозування динамічних сцен може бути досягнуто за допомогою аналізу часових рядів, забезпечуючи більш надійний вхід для прийняття рішень автомобіля.
На рівні прийняття рішень та планування традиційні автономні системи водіння зазвичай покладаються на заздалегідь встановлені правила або алгоритми планування на основі моделі для перетворення результатів сприйняття в рішення щодо планування шляхів та дій. Однак цей метод схильний до невдачі, коли стикається з складними умовами руху, які ніколи раніше не бачились, і конструкція інтерфейсу між кожним модулем є досить жорсткою, що ускладнює досягнення оптимізації в кінці. Через редакцію навчання в кінці, великі моделі можуть безпосередньо витягувати ключову інформацію з даних сирого датчика та генерувати команди управління транспортними засобами за допомогою властивих логічних міркувань. DriveGPT -4 та Languagempcc продемонстрували потенціал використання великих моделей для прийняття рішень з мульти завдання. Їх моделі можуть не лише генерувати розумні стратегії водіння у складних сценаріях, але й надати детальні пояснення, посилюючи інтерпретація системи. Перевага цього прийняття рішень полягає у зменшенні проміжних помилок у процесі передачі інформації та дозволу всієї системи мати можливість адаптуватися до нових сценаріїв.
Контроль транспортних засобів, як заключний крок автономного водіння, вимагає не лише точності прийняття рішень, але й гарантії реагування на реагування системи в режимі реального часу. Оскільки великі моделі зазвичай мають численні параметри та величезні обчислювальні витрати, у їх прямому розгортанні є певні проблеми в системах, встановлених автомобілями. Промисловість провела широкі дослідження у стисненні моделі та легкої ваги. Завдяки технології дистиляції моделі найважливіші знання у великих моделях витягуються, а потім переносяться на невеликі та ефективні моделі, щоб досягти ідеальної відповідності з обладнанням для транспортних засобів (наприклад, серії Nvidia Drive AGX). Ця технологія не тільки зберігає високу продуктивність великих моделей, але й забезпечує, що час відповіді відповідає вимогам контролю в режимі реального часу, таким чином відіграючи значну роль у процесі комерціалізації автономного водіння L3\/L4.
У моделюванні та перевірці закритого циклу автономного водіння великі моделі також продемонстрували значні переваги. Навчання з масштабними даними та синтетичними сценами може побудувати реалістичні світові моделі, а тестування із замкнутим циклом може бути досягнуто у віртуальному середовищі за допомогою цифрових технологій Twin. Цей метод не тільки суттєво знижує ризики та витрати на проведення великої кількості тестів на реальних дорогах, але також може швидко імітувати різні сценарії екстремальних та довгохвойних, забезпечуючи достатню підтримку даних для ітеративної оптимізації моделі. Модель EMMA Waymo, використовуючи імітаційні платформи та велику модельну технологію, досягла високоточного прогнозування траєкторії та прийняття рішень щодо уникнення зіткнення. Його продуктивність набагато перевищує продуктивність традиційних ієрархічних систем, забезпечуючи новий підхід до перевірки закритого циклу майбутніх повноцінних систем водіння.
Крім того, великі моделі також відіграли значну роль у підвищенні безпеки системи та досвіду користувачів. Автономне водіння - це не просто технічне питання; Він також передбачає взаємодію людини-комп'ютер та проблеми соціальної довіри. Завдяки технології обробки природних мов великі моделі можуть досягти розмов у реальному часі з драйверами, надавати пропозиції щодо водіння та аварійні сповіщення та навіть пропонувати персоналізовану допомогу на основі емоцій водія. Така конструкція взаємодії може значно покращити довіру пасажирів, що робить автономну систему водіння не лише більш досконалими в технологіях, але й більше відповідати потребам користувачів у практичних програмах.
Які виклики створюють великі моделі в автономному водінні?
Хоча великі моделі показали великий потенціал у галузі автономного водіння, все ще існує багато проблем у перетворенні їх з лабораторних досягнень на комерційні програми. Наразі продуктивність та обчислювальні ресурси в режимі реального часу є одним з головних вузьких місць. Великі моделі зазвичай мають великі масштаби параметрів та високу обчислювальну складність. Для створення рішень на рівні мілісекунд є надзвичайно високими вимогами до обчислювальної потужності платформи обчислювальних транспортних засобів. Можна використовувати спеціальні мікросхеми AI, і великі моделі можуть стискатися за допомогою таких методик, як дистиляція та квантування моделі, прагнення відповідати вимогам реагування в режимі реального часу, забезпечуючи продуктивність.
Проблеми безпеки та надійності також є основними проблемами у застосуванні великих моделей. Після того, як автономний транспортний засіб робить помилку прийняття рішень, наслідки можуть бути дуже серйозними. Тому великі моделі повинні пройти суворі тестування та перевірку, перш ніж їх застосовувати практичне використання, щоб переконатися, що вони зможуть правильно реагувати в різних складних та крайніх сценаріях. Через характер "чорної коробки" великих моделей, їх внутрішні процеси прийняття рішень часто важко пояснити. Як підвищити інтерпретація моделі, забезпечуючи, що висока продуктивність стала нагальною проблемою для вирішення регуляторних органів та автовиробників. В майбутньому, поєднуючи такі методи, як підкріплення, тонка настройка на основі зворотного зв’язку людини та обмеження правил, очікується, що розробити системи прийняття рішень, які є ефективними та прозорими.
Конфіденційність даних та етичні проблеми не можуть бути ігноровані ні при застосуванні великих моделей. Автономні системи водіння повинні зібрати велику кількість даних транспортних засобів, навколишнього середовища та користувачів, а також безпечне зберігання та використання цих даних безпосередньо пов'язані із захистом конфіденційності користувачів. Як повністю використовувати переваги великих даних, забезпечуючи безпеку передачі та обробки даних - це перше питання, з яким потрібно вирішити регуляторні органи. Необхідно сформулювати суворі стандарти захисту даних та механізми захисту конфіденційності, щоб забезпечити інституційні гарантії для безпечного застосування великих моделей автономного водіння.
Співпраця між програмним забезпеченням та обладнанням також є ключовим фактором для впровадження великих моделей. Успішне застосування великих моделей не тільки залежить від інновацій алгоритму, але й вимагає високопродуктивної апаратної підтримки. В даний час основні виробники послідовно запустили обчислювальні платформи нового покоління, такі як Nvidia Drive Agx Pegasus, Atlan тощо. Ці платформи надають гарантії обладнання для висновку в режимі реального часу та масштабного розгортання великих моделей. Постійне просування сенсорної технології також забезпечило більш рясні та якісні джерела даних для багатомодального синтезу даних. Завдяки постійному вдосконаленню всієї екосистеми автономного водіння, глибока інтеграція програмного забезпечення та апаратного забезпечення зобов’язана загнати всю галузь у абсолютно нову епоху інтелектуальних подорожей.
Глибокий вплив великих моделей на технологію автономного водіння не тільки відображається на технічних деталях, але й викликав зміну парадигми від традиційних модульних систем до кінця та від перцептивного інтелекту до когнітивного інтелекту. Майбутня автономна система водіння, очолювана великими моделями, досягне більш високого рівня сприйняття навколишнього середовища, більш гнучкого прийняття рішень та планування, а також більш безпечного та ефективного контролю транспортних засобів. У той же час він досягне нового рівня взаємодії людини-машини, персоналізованої допомоги та безпеки даних.