Grazie allo sviluppo dell'intelligenza artificiale guidata dal modello del grande linguaggio, la ricerca e l'applicazione dell'iconografia grafica hanno inaugurato una nuova opportunità, che sta promuovendo lo sviluppo del modello del grande linguaggio nel modello della grande visione." Il 30 dicembre 2023, in occasione della vigilia di Capodanno e del giorno di Capodanno, Wang Yaonan, accademico dell'Accademia cinese di ingegneria e direttore del National Engineering Research Center for Robot Visual Perception and Control Technology, ha condiviso le ultime tendenze nello sviluppo dell'intelligenza della visione artificiale alla 19a Conferenza dei giovani scienziati della Società cinese di grafica grafica.
In un'intervista esclusiva con il reporter Nandu, Wang Yaonan ha affermato che l'intelligenza artificiale rende la visione artificiale intelligente e che una maggiore potenza aritmetica può supportare l'addestramento di grandi modelli visivi. Tuttavia, i modelli di visione più intelligenti necessitano anche di livelli aritmetici più elevati, migliori architetture di modelli e algoritmi di apprendimento più efficaci.
Questa conferenza è organizzata dalla Chinese Society of Image Graphics, dal Pazhou Lab, dalla South China University of Technology, dalla Sun Yat-sen University e dal Youth Working Committee della Chinese Society of Image Graphics.
Parlando delle tendenze del settore
Dal visual computing all'intelligenza visiva
Yao-Nan Wang: La ricerca cinese sulla visione artificiale ha una storia di quasi 40 anni, inizialmente iniziata con lo studio dei sensori, ovvero: convertire le informazioni sulla luce in informazioni sulle immagini. La cosa successiva da fare è l'elaborazione della visione, incluso il miglioramento dell'immagine ottenuta per renderla più chiara.
Dopo aver ottenuto un'immagine chiara, dobbiamo ottenere il target che ci interessa dall'immagine. Ad esempio, nel campo della guida senza conducente, la visione artificiale deve rilevare i target nell'immagine, per rispondere alla domanda su quale sia una persona e quale un'auto.
Queste sono quelle che chiamiamo le tre aree principali della visione artificiale. Le riassumo in: imaging, elaborazione e comprensione.
La visione artificiale è passata dal visual computing del passato all'intelligenza visiva di oggi. Il visual computing combinato con l'intelligenza artificiale ha migliorato il livello di cognizione e potenziato la capacità di comprendere ambienti complessi, e l'intero settore dell'intelligenza visiva ha assistito a un rapido sviluppo nell'ultimo anno.
La direzione dello sviluppo dell'intelligenza della visione artificiale è quella di realizzare un'ampia gamma di applicazioni, applicate all'ispezione industriale, alla produzione intelligente, al telerilevamento satellitare e ad altri campi.
Parlando di visione artificiale, dobbiamo parlare della sua applicazione, dello sviluppo tecnologico guidato dall'applicazione. La Chinese Society of Image Graphics ha 30 comitati speciali, principalmente incentrati sulle immagini grafiche per svolgere ricerche, al servizio dell'economia nazionale. Queste tecnologie hanno un'ampia gamma di scenari applicativi, tra cui industria, agricoltura, sistemi di informazione geografica, telerilevamento, risorse del territorio e così via.
Una persona può vedere il mondo alla nascita e comprenderlo in seguito, e l'80% delle informazioni viene acquisito tramite la vista. La visione artificiale è quella di simulare l'occhio umano, e alla fine raggiungere il livello dell'occhio umano, e in alcuni aspetti superare l'occhio umano, per vedere più lontano, vedere più chiaramente.
Parla del modello di grande visione
Il grande modello visivo sarà sempre più intelligente
Yao-Nan Wang: Big Language Model è un'intelligenza artificiale basata sui dati che utilizza le conoscenze ricavate da libri, lingue e testi come dati per addestrare un modello di rete neurale in grado di ragionare e rispondere in base a ciò che ha appreso.
I dati per il grande modello visivo, d'altro canto, provengono principalmente da varie immagini, inclusi i dati visivi generati da esseri umani e natura. Ad esempio, il grande modello visivo medico consiste nell'inserire le immagini di organi e lesioni umane come dati visivi nel grande modello, e quindi addestrarlo a ottenerli, in modo che possa leggere le foto TC come un medico, e possa ottenere l'effetto di ragionare sulle condizioni del paziente dopo aver scattato le foto quando il paziente si reca dal medico.
L'attuale modello visivo non ha lo stesso cervello umano che immaginiamo, il divario è ancora molto ampio. Con l'aumento dei dati di apprendimento e l'adeguamento dei parametri del modello, il modello diventerà sempre più grande e sempre più conoscitivo, e il suo livello di intelligenza diventerà sempre più alto e più intelligente.
Dobbiamo aumentare il livello di potenza aritmetica e accelerare la velocità di calcolo per poter costruire modelli più velocemente; progettare architetture di modelli migliori, tra cui maggiore interpretabilità, maggiore sicurezza e controllo; e ricercare algoritmi di apprendimento più efficaci.
In realtà, la macromodellazione visuale non è una novità degli ultimi anni, è stata sviluppata passo dopo passo. Negli anni '80, con lo sviluppo dell'intelligenza artificiale, le persone hanno iniziato a studiare le reti neurali. È solo che negli ultimi anni le capacità aritmetiche e algoritmiche sono aumentate in modo che le persone possano provare a costruire grandi modelli, dando origine a grandi modelli linguistici e grandi modelli visivi. In passato, quando non c'era abbastanza potenza aritmetica, le persone non creavano modelli così grandi.
Parlando delle prospettive per il 2024
Ci auguriamo che l'attività si espanda da Guangzhou a tutto il Paese e al mondo.
Yaonan Wang: Nel 2022, il Centro nazionale di ricerca ingegneristica per la tecnologia di percezione visiva e controllo dei robot dell'Università di Hunan si è trasferito a Guangzhou Zengcheng, nella Greater Bay Area del Guangdong-Hong Kong-Macao, e ha fondato l'HU Guangdong-Hong Kong-Macao Greater Bay Area Innovation Research Institute (Guangzhou Zengcheng).
L'istituto si concentra sulla ricerca e l'applicazione della visione intelligente per le macchine, compresi robot operativi speciali nei campi della produzione intelligente, della medicina e della farmaceutica, nonché modelli di visione di grandi dimensioni generalizzati. Ad esempio, queste ricerche sono applicate all'industria manifatturiera, che può sostituire un gran numero di lavoratori e completare l'ispezione della qualità del prodotto, in particolare nell'industria 3C e dei componenti di fascia alta. Attualmente, l'istituto ha sviluppato sistemi software e hardware, la cui funzione principale è quella di potenziare la trasformazione digitale e intelligente delle imprese del Guangdong e promuovere lo sviluppo dell'industria manifatturiera.
Inoltre, l'istituto realizza anche sistemi di visione artificiale e di controllo intelligenti, utilizzati principalmente nella produzione di apparecchiature intelligenti di fascia alta, come il software Internet industriale, che dispone di un numero molto elevato di algoritmi.
Il Guangdong è in prima linea nella riforma e nell'apertura e il principale campo di battaglia economico, con una catena industriale e una catena di fornitura complete e molte imprese manifatturiere, siamo arrivati al layout del Guangdong in primo luogo a causa della domanda del mercato. Inoltre, il nostro centro di ricerca ha un certo numero di team di R&S nel Guangdong che ha ottenuto molti progetti, la trasformazione dei risultati scientifici e tecnologici.
Nella prima metà del 2023, abbiamo incontrato alcune sfide, principalmente nella fornitura di parti e componenti. Nel 2024, credo che questi problemi saranno risolti e la catena industriale, la catena di fornitura e le capacità di R&S dell'industria AI del Guangdong saranno migliorate. Nel grande mercato interno, si apriranno nuove piste. In un'atmosfera vibrante, con tutti che prendono l'iniziativa, agiscono e innovano, tutte le sfide possono essere risolte.
Sono fiducioso nello sviluppo del settore dell'intelligenza artificiale nel Guangdong. Negli ultimi 30 anni, abbiamo fatto molti sforzi per essere autosufficienti nella scienza e nella tecnologia e abbiamo accumulato molti risultati di ricerca scientifica. Il Guangdong è la provincia economica più grande della Cina.
Il campo dell'intelligenza artificiale e della robotica in cui siamo impegnati ha colto una buona opportunità, che è cresciuta in modo esplosivo negli ultimi due anni, portando molti nuovi mercati e tirando fuori nuovi binari industriali. Ci saranno sempre più terminali intelligenti in futuro, il che porterà anche allo sviluppo delle strutture di produzione e dell'industria delle attrezzature. Nel 2024, spero che il nostro istituto di ricerca a Zengcheng, Guangzhou, sarà in grado di portare la nostra attività in tutto il paese e nel mondo.
