Un nuovo studio esplora la sincronia neurale tra modelli linguistici di grandi dimensioni (LLM) che interagiscono socialmente. La ricerca suggerisce che la sincronia neurale potrebbe essere un indicatore della socialità degli LLM, riflettendo l'impegno sociale e l'allineamento temporale durante le interazioni. I risultati evidenziano una correlazione tra la sincronia neurale e le performance sociali degli LLM, aprendo nuove prospettive sull'analisi delle "menti sociali" di questi modelli.
Un nuovo studio affronta il problema del bias testuale nei benchmark di Multiple Choice Question Answering (MCQA) per i Vision Language Model (VLM) utilizzati nella guida autonoma. La ricerca propone un metodo per ridurre le scorciatoie linguistiche, forzando i modelli a basarsi sulla comprensione visiva.
Un nuovo studio esplora come le ontologie formali, in particolare nel campo della matematica, possano migliorare l'affidabilità dei modelli linguistici tramite generazione aumentata dal recupero di informazioni. I risultati mostrano che l'accuratezza del recupero è cruciale: un contesto pertinente migliora le prestazioni, mentre un contesto irrilevante le peggiora.
Una nuova ricerca identifica come i problemi di allineamento negli LLM, come la tendenza all'adulazione e le allucinazioni, non siano semplici errori, ma comportamenti razionali derivanti da modelli imperfetti. Lo studio propone un nuovo approccio per migliorare la sicurezza degli agenti AI, concentrandosi sulla loro interpretazione della realtà piuttosto che sulla manipolazione delle ricompense ambientali.
Il modello Qwen3 Text-to-Speech (TTS) utilizza voice embedding per la clonazione vocale. La voce viene trasformata in un vettore (1024 o 2048 dimensioni per la versione 1.7b), permettendo la modifica delle voci tramite operazioni matematiche, come cambio di genere, tono, o creazione di spazi emozionali. È stato estratto un encoder per uso standalone, con modelli ONNX disponibili per inference ottimizzata.
Un utente ha testato Qwen3-code-next su un Mac Studio Ultra con 128GB di RAM, riscontrando prestazioni inizialmente promettenti nello sviluppo di codice. Tuttavia, con l'aumentare della complessità del progetto e del contesto, sono emersi problemi di timeout e gestione della memoria, limitando l'efficacia del modello per task di sviluppo di media difficoltà.
OpenAI e Paradigm presentano EVMbench, un benchmark per valutare le capacità degli agenti AI nell'individuare, correggere e sfruttare vulnerabilità ad alta severità negli smart contract. Lo strumento mira a migliorare la sicurezza nel mondo delle applicazioni decentralizzate.
ByteDance ha rilasciato SeaDance 2.0, un modello di generazione video che accetta input multipli (testo, immagini, video, audio) e produce clip a 2K con audio sincronizzato. Hollywood ha reagito con minacce di azioni legali, con Disney e Paramount che hanno inviato diffide. Il modello non è open source.
Il team di Qwen ha verificato seri problemi di qualità dei dati nei set di test GPQA e HLE (Humanity's Last Exam). Un'analisi approfondita ha rivelato che molte risposte considerate "gold standard" erano errate, compromettendo l'affidabilità dei benchmark. La scoperta è stata inizialmente sollevata da ricercatori indipendenti.
La community open source focalizzata sull'esecuzione di modelli linguistici di grandi dimensioni (LLM) in locale, tramite l'iniziativa LocalLLaMA, discute attivamente le aspettative per i prossimi modelli da 9 e 35 miliardi di parametri. L'interesse si concentra sull'ottimizzazione delle prestazioni e sull'efficienza nell'utilizzo di risorse hardware limitate, tipiche degli ambienti on-premise.
FlashLM v5, un modello linguistico con 29.7 milioni di parametri, è stato addestrato su una CPU AMD Ryzen 7950X3D in circa 40 ore. Il modello ha raggiunto una perplexity di 1.36, superando la baseline TinyStories-1M (PPL 1.59). L'architettura ParallelGatedRecurrence utilizza pesi ternari e non richiede moltiplicazioni di matrici nel forward pass.
Una discussione online rivela utilizzi inattesi per i modelli linguistici di grandi dimensioni eseguiti in locale. Dalla generazione di prompt specifici all'analisi di dati sensibili, gli utenti esplorano le potenzialità degli LLM on-premise per applicazioni specializzate, spesso vincolate da requisiti di privacy o costi proibitivi del cloud.
Un nuovo meccanismo di attenzione per LLM, Wave Field LLM, utilizza equazioni d'onda per scalare a O(n log n). Il modello mappa i token su un campo continuo 1D e propaga le informazioni tramite equazioni d'onda smorzate. I risultati iniziali su WikiText-2 mostrano prestazioni competitive rispetto ai transformer standard, con vantaggi crescenti per sequenze più lunghe.
Risolti i problemi di inference con Ouro-2.6B-Thinking di ByteDance, un modello Universal Transformer ricorrente. La correzione riguarda incompatibilità con Transformers 4.55. Le consegne ora producono risultati validi. Testato su NVIDIA L4 con prestazioni di 3.8 token/s e 5.3 GB di VRAM.
Un post su Reddit evidenzia l'impatto potenziale di figure di spicco come Andrej Karpathy nello sviluppo di modelli linguistici di grandi dimensioni (LLM) open source. La discussione sottolinea come la presenza di esperti possa accelerare significativamente il progresso e la competitività in questo campo.
È disponibile su Hugging Face un modello distillato, denominato GLM-4.7, progettato per offrire capacità di ragionamento avanzate. Questa versione, menzionata da Unsloth, mira a fornire prestazioni elevate in contesti di utilizzo locale. Il modello è disponibile in formato GGUF, facilitandone l'implementazione su diverse piattaforme hardware.
Un utente ha scoperto che GLM-5, un modello linguistico di grandi dimensioni, cambia significativamente il suo comportamento quando gli viene detto di essere Claude di Anthropic. Questo cambio di personalità sembra anche aggirare alcune censure integrate nel modello. Resta da capire se questo comportamento sia intenzionale o un'emergenza spontanea.
Google ha annunciato l'imminente rilascio di una nuova versione di Gemma, il suo modello linguistico di grandi dimensioni (LLM). La notizia è emersa da un post su Reddit, segnalato dalla comunità LocalLLaMA, che rimanda a un video su YouTube.
Un modello di intelligenza artificiale si confronta con il First Proof math challenge, una competizione che mette alla prova le capacità di ragionamento su problemi complessi. L'iniziativa mira a valutare le performance dei modelli AI in scenari che richiedono competenze di livello esperto.
La piattaforma OpenRouter registra un'impennata nell'utilizzo di modelli di linguaggio di origine cinese. Per la prima volta, un modello supera i 3 trilioni di token elaborati in una settimana, e più modelli superano il trilione, segnando un cambio di passo rispetto alla predominanza dei modelli statunitensi.