Introduzione a Phi Silica

Importante

Le API Phi Silica fanno parte di una funzionalità di accesso limitato (vedere classe LimitedAccessFeatures). Per altre informazioni o per richiedere un token di sblocco, usare il modulo di richiesta token di accesso LAF.

Importante

Phi Silica viene sostituito da Aion Instruct, un nuovo modello su dispositivo. Iniziare a pianificare la transizione ora:

Settembre 2026 — pacchetto autonomo installabile manualmente disponibile per i test e l'addestramento LoRA. Scarica il pacchetto, verifica Aion Instruct per la tua app e addestra nuovamente i tuoi LoRA usando Foundry Toolkit.

Ottobre 2026 : Aion Instruct inizia a distribuire i dispositivi Windows Insider Preview. Phi Silica rimane disponibile; il modello attivo è gestito da un Controlled Feature Rollout (CFR) di Windows. Gli sviluppatori possono eseguire test affiancati mediante una chiave del Registro di sistema di Windows.

Novembre 2026 — Aion Instruct viene distribuito sui dispositivi retail e Phi Silica viene rimosso.

Phi Silica è un potente modello linguistico locale accelerato dall'hardware che offre molte funzionalità disponibili nei modelli di linguaggio di grandi dimensioni. Nei dispositivi dotati di NPU, il modello usa una tecnica denominata decodifica speculativa per accelerare la generazione di testo usando un modello bozza più piccolo che può proporre più sequenze di token e essere convalidato in parallelo dal modello principale.

Annotazioni

Le caratteristiche di Phi Silica non sono disponibili in Cina.

Phi Silica è ottimizzato per l'efficienza e le prestazioni in Windows Copilot+ PCs (in cui viene eseguito sulla NPU) e su dispositivi non Copilot+ Windows 11 con una GPU supportata e possono essere integrati nelle app Windows tramite le API di intelligenza artificiale Windows in SDK per app di Windows.

Questo livello di ottimizzazione non è disponibile in altre versioni di Phi.

Hardware supportato

Phi Silica viene eseguito sull'hardware seguente:

Hardware Condizione dettagli
NPU (Copilot+ PC) ✅ Disponibile Prestazioni migliori. Vedere Copilot+ PCs developer guide.
GPU — NVIDIA ✅ Disponibile Serie GeForce RTX 30 e versioni successive con vRAM da 6+ GB.
GPU - AMD ✅ Disponibile Serie RX RX 9060 e versioni successive con 6+ GB di vRAM.

Per i requisiti dei driver GPU, vedere Requisiti dei driver GPU.

Importante

L'esecuzione di Phi Silica nella GPU richiede l'abilitazione della modalità sviluppatore . Passare a Impostazioni>Sistema>per sviluppatori>Modalità sviluppatore.

Prerequisiti gpu:

  • Windows build: Programma Windows Insider Canale sperimentale, build 26300.8553 o versione successiva
  • SDK per app di Windows: versione 2.2.2-sperimentale9 (giugno 2026 sperimentale) o successiva

Requisiti dei driver GPU

L'esecuzione di Phi Silica in GPU richiede l'installazione del driver più recente direttamente dal produttore della GPU. I driver predefiniti di Windows Update o installazioni OEM potrebbero non essere sufficienti e possono causare errori o prestazioni ridotte.

Scaricare il driver più recente per l'hardware:

Annotazioni

I driver forniti dall'OEM (forniti tramite Windows Update o lo strumento di aggiornamento del produttore del PC) potrebbero sovrascrivere i driver IHV installati in precedenza. Se Phi Silica smette di lavorare sulla GPU dopo un aggiornamento del sistema, reinstallare il driver più recente dai collegamenti precedenti.

Differenze tra le funzionalità gpu

Le funzionalità seguenti si comportano in modo diverso rispetto alla GPU rispetto alla NPU:

  • Compressione dei prompt: disponibile su NPU ma non disponibile su GPU. Le applicazioni che si basano sulla compressione dei prompt per finestre di contesto più lunghe devono tenere conto di questo quando la destinazione è dispositivi GPU.
  • Decodifica speculativa: disponibile in NPU per la generazione di testo accelerata. Attualmente non disponibile nella GPU, il che può comportare una velocità effettiva dei token al secondo inferiore.
  • Ottimizzazione loRA: gli adattatori LoRA devono essere sottoposti a training nel cloud usando il kit di Fine-Tuning (FTK). L'inferenza con l'adattatore addestrato può essere testata localmente usando AI Dev Gallery. Questo flusso di lavoro è lo stesso per NPU e GPU.

Disponibilità e download del modello

A differenza del modello NPU, preinstallato in Copilot+ PCs, il modello Phi Silica per GPU è non preinstallato nel dispositivo dell'utente. Al contrario, il modello viene scaricato su richiesta la prima volta che l'app chiama EnsureReadyAsync. Il download è di diversi gigabyte e viene eseguito in background tramite Windows Update.

Poiché il modello GPU Phi Silica è di grandi dimensioni, visualizzare una finestra di dialogo di conferma prima di chiamare EnsureReadyAsync in modo che l'utente possa fornire il consenso sia al costo di archiviazione che al download in background. Modello tipico:

  1. Chiama GetReadyState e dirama il flusso in base al valore restituito di AIFeatureReadyState:

    • Ready — il modello è installato; Procedere.
    • NotReady oppure EnsureNeeded : mostra la finestra di dialogo di consenso (vedere di seguito), quindi chiama EnsureReadyAsync solo se l'utente accetta.
    • NotSupportedOnCurrentSystem — l'hardware dell'utente non soddisfa i requisiti in Hardware supportato. Offrire un'esperienza di fallback e, se appropriato, presentare i requisiti hardware in modo che l'utente possa prendere una decisione di aggiornamento informata.
  2. Nella finestra di dialogo di consenso spiegare:

    • Verrà scaricato un modello linguistico facoltativo (diversi GB di spazio di archiviazione).
    • Il download avviene in background tramite Windows Update.
    • L'utente può monitorare lo stato di avanzamento del download in Settings>Windows Update.
    • L'utente può successivamente rimuovere il modello in Impostazioni Componenti>di intelligenza artificiale di> se non lo vuole più.

    Suggerimento

    Nelle stringhe rivolte all'utente (testo del dialogo, messaggi di stato), fare riferimento al modello come "modello linguistico" o "modello di intelligenza artificiale facoltativo" anziché "Phi Silica". La maggior parte degli utenti finali non ha familiarità con il nome del marchio e i termini generici comunicano più chiaramente lo scopo.

  3. Mentre EnsureReadyAsync è in corso, mostra un indicatore di stato nella tua app. L'operazione restituita espone un'opzione di stato che determina un'interfaccia utente di caricamento; Per informazioni dettagliate, vedere Introduzione alle API di intelligenza artificiale Windows.

Dopo l'installazione del modello

Il modello rimane sul dispositivo fino a quando l'utente non lo rimuove. Gli utenti gestiscono i modelli installati in Impostazioni> Componentidi intelligenza artificiale del>, in cui il modello GPU Phi Silica viene visualizzato come "AI LanguageModel". Se in un secondo momento l'utente rimuove il modello, la chiamata successiva dell'app a GetReadyState restituisce NotReady o EnsureNeeded e il flusso di consenso e download deve essere ripetuto.

Per informazioni dettagliate sull'API, vedere:

Integrare Phi Silica

Con un modello linguistico Phi Silica locale è possibile generare risposte di testo alle richieste degli utenti. Prima di tutto, assicurarsi di avere i prerequisiti e i modelli disponibili nel dispositivo, come descritto in Introduzione alle API di intelligenza artificiale Windows.

Specificare i namespace richiesti

Per usare Phi Silica, verifica di utilizzare i namespace necessari:

using Microsoft.Windows.AI;
using Microsoft.Windows.AI.Text;
#include "winrt/Microsoft.Windows.AI.Text.h"
using namespace Microsoft::Windows::AI;
using namespace Microsoft::Windows::AI::Text;

Generare una risposta

Questo esempio mostra come generare una risposta a un prompt di domande e risposte con moderazione del contenuto personalizzata (vedere Moderazione del contenuto con le API di intelligenza artificiale di Windows).

  1. Verificare che il modello linguistico sia disponibile chiamando il metodo GetReadyState e attendendo che il metodo EnsureReadyAsync restituisca correttamente.

  2. Quando il modello linguistico è disponibile, creare un oggetto LanguageModel per farvi riferimento.

  3. Inviare una richiesta di stringa al modello usando il metodo GenerateResponseAsync, che restituisce il risultato completo.

if (LanguageModel.GetReadyState() == AIFeatureReadyState.NotReady) 
{ 
   var op = await LanguageModel.EnsureReadyAsync(); 
} 

using LanguageModel languageModel = await LanguageModel.CreateAsync();

string prompt = "Provide the molecular formula for glucose.";

LanguageModelOptions options = new LanguageModelOptions();
ContentFilterOptions filterOptions = new ContentFilterOptions();
filterOptions.PromptMaxAllowedSeverityLevel.Violent = SeverityLevel.Minimum;
options.ContentFilterOptions = filterOptions;

var result = await languageModel.GenerateResponseAsync(prompt, options);
 
Console.WriteLine(result.Text);
if (LanguageModel::GetReadyState() == AIFeatureReadyState::NotReady)
{
    auto op = LanguageModel::EnsureReadyAsync().get();
}

auto languageModel = LanguageModel::CreateAsync().get();

const winrt::hstring prompt = L"Provide the molecular formula for glucose.";

LanguageModelResponseResult result = languageModel.GenerateResponseAsync(prompt).get();
std::cout << result.Text().c_str() << std::endl;

La risposta generata da questo esempio è:

C6H12O6

Competenze di intelligenza testuale

Phi Silica include funzionalità integrate di trasformazione del testo (note come abilità di intelligenza del testo) che possono fornire risposte strutturate, concise e facili da usare tramite la formattazione predefinita utilizzando un modello linguistico locale.

Le competenze supportate includono:

  • Da testo a tabella: formatta la risposta della richiesta in un formato di tabella strutturata, se appropriato.
  • Riepilogo: restituisce un riepilogo conciso del testo della richiesta.
  • Riscrittura: riformula il testo del prompt per ottimizzare chiarezza, leggibilità e, se specificato, tono (o stile).

I passaggi seguenti descrivono come usare le competenze di Intelligence per il testo.

  1. Creare un oggetto LanguageModel
    Questo oggetto fa riferimento al modello linguistico Phi Silica locale (ricordarsi di verificare che il modello Phi Silica sia disponibile nel dispositivo).

  2. Istanziare l'oggetto specifico delle competenze
    Scegliere la classe appropriata in base alla competenza da applicare e passare l'istanza languageModel come parametro.

  3. Chiama il metodo per eseguire l'abilità
    Ogni competenza espone un metodo asincrono che elabora l'input e restituisce un risultato formattato.

  4. Gestire la risposta
    Il risultato viene restituito come oggetto tipizzato, che è possibile stampare o registrare in base alle esigenze.

In questo esempio viene illustrata la competenza di riepilogo del testo.

  1. Creare un'istanza languageModel (languageModel).
  2. Passare LanguageModel al costruttore TextSummarizer .
  3. Passare del testo al metodo SummarizeAsync e stampare il risultato.
using namespace Microsoft.Windows.AI.Text;

using LanguageModel languageModel = await LanguageModel.CreateAsync();

var textSummarizer = new TextSummarizer(languageModel);
string text = @"This is a large amount of text I want to have summarized.";
var result = await textSummarizer.SummarizeAsync(text);

Console.WriteLine(result.Text); 
using namespace Microsoft::Windows::AI::Text;

auto languageModel = LanguageModel::CreateAsync().get();
auto textSummarizer = TextSummarizer(languageModel);
std::string prompt = "This is a large amount of text I want to have summarized.";
auto result = textSummarizer.SummarizeAsync(prompt);

std::wcout << result.get().Text() << std::endl;

Intelligenza artificiale responsabile

Sono stati seguiti i principi e le procedure di base descritti negli standard di intelligenza artificiale responsabile Microsoft per garantire che queste API siano affidabili, sicure e create in modo responsabile. Per altri dettagli sull'implementazione delle funzionalità di intelligenza artificiale nell'app, vedere Sviluppo di intelligenza artificiale generativa responsabile in Windows.

Note sulla trasparenza della GPU

Per informazioni dettagliate sulle funzionalità, le limitazioni e l'uso responsabile di Phi Silica in non Copilot+ PCs (GPU), vedere la nota Transparency Note: Phi Silica on Non-Copilot+ PCs.

Differenze principali tra l'esecuzione di NPU e GPU:

Fattore Copilot+ PC (NPU) Non Copilot+ PCs (GPU)
Latenza di inferenza Ottimizzato; bassa latenza grazie all'accelerazione NPU e alla decodifica speculativa Latenza più elevata; dipende dalla generazione della GPU, dalla VRAM e dal carico GPU corrente
Consumo energetico La NPU è efficiente per l'alimentazione, adatta per l'uso a batteria Maggiore consumo di energia; può influire sulla durata della batteria sui portatili
Compressione dei prompt ✅ Disponibile ❌ Non disponibile nella GPU
Decodifica speculativa ✅ Disponibile ❌ Non disponibile nella GPU
Facoltatività del modello Il modello viene gestito dal sistema Il modello viene scaricato su richiesta e può essere rimosso tramite Impostazioni>Componenti di intelligenza artificiale>
Fattori operativi per i PC non Copilot+
  • Diversità hardware: i PC non Copilot+ comprendono un'ampia gamma di configurazioni GPU. Le prestazioni variano in modo significativo in questo spettro di dispositivi.
  • Requisiti hardware minimi: i dispositivi devono soddisfare i requisiti minimi di GPU e memoria per eseguire Phi Silica.
  • Dipendenze software: L'esecuzione su PC non Copilot+ richiede l'installazione del driver GPU IHV più recente, installato direttamente dal produttore della GPU (NVIDIA). I driver predefiniti di Windows Update o installazioni OEM potrebbero non essere sufficienti e possono causare errori o prestazioni ridotte.

Prestazioni del sistema

Comprendere le prestazioni sui PC non Copilot+

La qualità di output di Phi Silica (accuratezza, coerenza, pertinenza) è coerente tra Copilot+ e non Copilot+ PCs perché vengono usati gli stessi pesi e architetture del modello. Le differenze principali sono la velocità di inferenza, il consumo di risorse e la velocità di risposta dell'esperienza utente.

Gli sviluppatori devono:

  • Benchmark sull'hardware rappresentativo: eseguire test su un intervallo di dispositivi non Copilot+ che riflettono la base utente di destinazione, incluse le configurazioni di fascia inferiore.
  • Impostare le aspettative degli utenti: comunicare chiaramente che i tempi di risposta possono variare in base all'hardware del dispositivo. Valutare la possibilità di visualizzare indicatori di stato o di streaming di risultati parziali.
  • Implementare timeout e fallback: per scenari in cui il tempo di risposta è critico, implementare timeout appropriati e valutare la possibilità di offrire opzioni di fallback basate sul cloud (con il consenso dell'utente).
  • Monitorare l'utilizzo delle risorse: tenere traccia dell'utilizzo della GPU, del consumo di VRAM e dell'utilizzo della memoria di sistema durante l'inferenza per identificare e risolvere i colli di bottiglia delle prestazioni.

Vedere anche