Please use this identifier to cite or link to this item: http://hdl.handle.net/11422/29994

Type: Dissertação
Title: Uma arquitetura de rede neural com offloading para dispositivos com memória e processamento limitados
Author(s)/Inventor(s): Medeiros, Caio Gevegir Miguel
Advisor: Couto, Rodrigo de Souza
Co-advisor: Cruz Caminha, Pedro Henrique
Abstract: Inferir dados por redes neurais profundas (Deep Neural Networks – DNNs) pode ser inviável em dispositivos de baixo poder computacional, como sistemas embarcados e microcontroladores. Dada a necessidade de armazenar muitas camadas de processamento na memória e o uso de operações aritméticas complexas, muitas delas recorrem a CPUs e GPUs de alta-performance e dedicadas. Uma alternativa para utilizar DNNs nesses dispositivos é a técnica de offloading, isto é, atribuir esse processamento complexo a outro dispositivo de maior poder computacional, como uma máquina virtual em um serviço de nuvem. Porém, ao atribuir boa parte do processamento a um dispositivo terceiro, o sistema depende da disponibilidade da nuvem, expondo-o aos riscos de instabilidade na rede e atrasos na transmissão de dados. Esta dissertação propõe o modelo HOENN (Hybrid Offloading Embedded Neural Network), um modelo híbrido composto por uma rede neural otimizada em alocação de memória e operações aritméticas para dispositivos de baixo custo e uma rede neural profunda hospedada em uma máquina virtual na nuvem. Além disso, utiliza-se uma métrica de confiança na inferência, junto com um limiar calculado, responsável por decidir se o processamento será finalizado no dispositivo ou na nuvem. Assim, o modelo HOENN recebe os dados e realiza a inferência com a rede neural simplificada. À esta inferência, é atribuído um índice de confiança. Caso este índice esteja acima do limiar pré-estabelecido, a inferência é mantida e enviada ao usuário. Caso contrário, essa é descartada e os dados são enviados para a nuvem para uma segunda inferência pela DNN. Experimentos em um sistema de dispositivo de baixo custo – ESP32S – com conexão à nuvem – AWS t2.medium –, com um conjunto de dados de dígitos numéricos manuscritos, mostram que é possível reduzir a quantidade dados enviados para nuvem em 75%, com uma redução de 50% no tempo médio de inferência, em comparação a realizar todas as operações na nuvem, sob uma penalidade de apenas 10% na acurácia do sistema.
Abstract: Data inferece by deep neural networks (DNNs) on low cost devices, such as embedded systems and microcontrollers, may be impracticable. Given the need of storing many layers on memory, plus the use of complex arithmetic operations, many of these DNNs resorts to high-performance and dedicated CPUs and GPUs. An alternative to use these DNNs on low cost devices is to use offloading. In other words, assign the complex processing to a high-performance device, such as a virtual machine hosted on a cloud service. However, assigning the majority of the processing to a third-party device, the system becomes dependable of the cloud’s availability, exposing it to the risks of network unstability and data transmission delays. This research proposes the HOENN model (Hybrid Offloading Embedded Neural Network), a hybrid model composed by a memory-arithmetical optimized neural network for low cost devices and a DNN hosted on a virtual machine on a cloud service. In addition, the model implements a confidence metric, and a threshold value, to decide whether the device’s inference is finished on the device or on the cloud. This way, the HOENN model receives input data and infers using the optimized neural network. For each inference, a confidence value is assigned. If this value surpasses the threshold, the inference is kept and sent to the end-user. If not, this inference is discarded and the input data is sent to the cloud to a second inference by the DNN. Experiments on a low cost device – ESP32S – connected to the cloud – AWS t2.medium –, using a dataset of handwritten numeric digits, show that it is possible to reduce the amount of data sent to the cloud by 75%, with a reduction of 50% on average inference time, when compared to inferring only on the cloud, under a penalty of only 10% on system’s accuracy.
Keywords: Offloading
Redes neurais
Computação na Borda Extrema
Inferência
Sistemas embarcados
Internet das coisas
Neural networks
Extreme Edge Computing
Inference
Embedded systems
Internet of things
Subject CNPq: CNPQ::ENGENHARIAS::ENGENHARIA ELETRICA::ELETRONICA INDUSTRIAL, SISTEMAS E CONTROLES ELETRONICOS::AUTOMACAO ELETRONICA DE PROCESSOS ELETRICOS E INDUSTRIAIS
CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::SISTEMAS DE COMPUTACAO::ARQUITETURA DE SISTEMAS DE COMPUTACAO
Program: Programa de Pós-Graduação em Engenharia Elétrica
Production unit: Instituto Alberto Luiz Coimbra de Pós-Graduação e Pesquisa de Engenharia
Publisher: Universidade Federal do Rio de Janeiro
Issue Date: Dec-2023
Publisher country: Brasil
Language: por
Right access: Acesso Aberto
Citation: MEDEIROS, Caio Gevegir Miguel. Uma arquitetura de rede neural com offloading para dispositivos com memória e processamento limitados. 2023. 66 f. Dissertação (Mestrado) - Curso de Programa de Pós-Graduação em Engenharia Elétrica, COPPE, Universidade Federal do Rio de Janeiro, Rio de Janeiro, 2023.
Appears in Collections:Engenharia Elétrica

Files in This Item:
File Description SizeFormat 
CGMMedeiros.pdf670.02 kBAdobe PDFView/Open ???org.dspace.app.webui.jsptag.ItemTag.restrict???


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.