Rilasciato il 4 luglio 2026·Stato: in-progress
ESP32-P4 Voice Assistant: Dispositivo Vocale Locale & AI Audio
Prototipo di assistente vocale da scrivania basato sul microcontroller ESP32-P4, con streaming audio bidirezionale a bassa latenza, display touch e integrazione con modelli linguistici.
ESP32-P4C++Audio StreamingWebSocketsPythonGemini Audio APII2S
GitHub Repository ↗Il Concetto
Gli assistenti vocali commerciali (Alexa, Google Home) dipendono interamente dai server cloud dei big tech, registrano costantemente l’ambiente domestico e hanno limitate capacità di comprensione del contesto rispetto ai moderni modelli di intelligenza artificiale generativa multimodale.
L’Architettura Sperimentale
- Hardware Core (ESP32-P4): Sfruttamento del nuovo processore RISC-V dual-core ad alte frequenze con supporto esteso alla grafica MIPI-DSI e gestione nativa di flussi audio digitali.
- Codec Audio I2S & Microfoni MEMS: Campionamento audio in tempo reale con filtraggio del rumore di fondo locale.
- Pipeline di Comunicazione WebSocket: Canale duplex bidirezionale compresso verso un microservizio Python locale su Proxmox VE.
- Interazione Multimodale: Streaming dell’audio direttamente verso endpoint con capacità audio native (Gemini Audio / LLM) e sintesi vocale di ritorno riprodotta dall’altoparlante integrato con latenza sub-secondo.