
DeepSeek-V3.2-Exp er ankommet som en eksperimentel iteration, der fokuserer på effektivitet i stor skala og i lange kontekster, med en klar reference til fællesskabet: open source, publicerede kerner og en billigere API.
Ud over støjen er nøglen, at denne model, baseret på V3.1-Terminuslancerer en finmasket mekanisme til spars attention kaldet DeepSeek Sparse Attention (DSA), der accelererer træning og inferens, samtidig med at kvaliteten opretholdes. Virksomheden har allerede lanceret den i App, web og API, og har sænket forbrugspriserne med mere end 50%, et aggressivt træk, der ærligt talt sætter konkurrenterne under pres.
Vigtige nye funktioner i DeepSeek-V3.2-Exp
Stjerneinnovationen er DSA, som tillader en selektiv opmærksomhed på relevante dele af konteksten uden udtømmende at gennemgå hele sekvensen. Ifølge virksomheden selv er påvirkningen på kvaliteten meget lav, mens effektivitetsgevinst i en lang sammenhæng er det håndgribeligt.
I tilgængelighed er modellen operationel i applikation, web og API fra dag ét, ledsaget af et betydeligt prisfald (50%+) for at lette testning og implementering. For dem, der ønsker at sammenligne, opretholder DeepSeek en midlertidigt endepunkt fra V3.1-Terminus indtil 15. oktober 2025 kl. 15:59 UTC.
DeepSeek-V3.2-Exp ydeevne og benchmarks: paritet med V3.1-Terminus
DeepSeek har søgt efter paritet med V3.1-Terminus på en bred vifte af tests, netop for at isolere effekten af at introducere spredt opmærksomhed. I praksis resulterer dette i sammenlignelige målinger i ræsonnement, kodning og brug af agent-lignende værktøjer.
Forskellige kilder angiver tal, der hjælper med at sætte forventningerne: V3.2-Exp beskrives som en model med 685 milliarder parametre og lignende ydeevne eller med små variationer afhængigt af domænet. I værktøjsfri argumentation citeres tal som 85.0 MMLU-Pro og 89.3 ind FORMÅL 2025; i agentscenarier optræder 40.1 i BrowseComp og 67.8 ind SWE-verificeretDette er resultater, der stemmer overens med den officielle fortælling om validere effektivitet i stedet for at forfølge et stort spring i præcision.
Der er endda fine sammenligninger: i kodningsopgaver, en stigning til 2121 i Codeforces sammenlignet med 2046, mens der i mere humanistiske tests observeres små fald (f.eks. 19.8 sammenlignet med 21.7 i Humanity's Last Exam). Samlet set tyder tabellen på balance: specifikke forbedringer og små indrømmelser, med hastighed som hovedfokus.
DSA: Finkornet spredt opmærksomhed, fortalt tydeligt
Klassisk pleje bliver dyr med brede kontekster; DSA Minimerer arbejde, hvor det bidrager lidt. Ved at anvende sparsity med finkornet kontrol koncentrerer modellen beregningen, hvor den rent faktisk finder signalet, hvilket forbedrer latens og reducere forbruget uden at forvrænge produktionen.
På niveau med reel erfaring er dette mærkbart i opgaver, der kræver en masse kontekstlange dokumentresuméer, loganalyse, agenter, der afholder lange dialoger, eller pipelines, der blander hentning og generering. Lige dér, effektivitet Det er ikke en luksus: det er forskellen på, om noget kan bruges i stor skala eller ej.
Tilgængelighed, priser og sammenligninger af DeepSeek-V3.2-Exp
DeepSeek har annonceret, at V3.2-Exp nu er tilgængelig på App, web og APIDerudover har den reduceret prisen på API'en med mere end 50% med øjeblikkelig virkning, en beslutning, der har til formål at udvide adoptionen og fremme sammenlignende tests.
For dem, der ønsker at sammenligne med den tidligere model, er V3.1-Terminus vedligeholdt i en endepunkt midlertidig indtil 15/10/2025 15:59 (UTC). Virksomheden opfordrer også til at indsende forslag tilbagemeldinger gennem en offentlig formular, der styrker en dynamik af løbende forbedringer i fællesskabet.
Status for åben kildekode: vægte, teknisk rapport og kerner
DeepSeek udgiver modellen i Hugging Face, sammen med en teknisk rapport der dokumenterer ændringer og resultater. Der er en klar forpligtelse til gennemsigtighed og til at fremme langsigtet anvendt forskning med lavere omkostninger.
På kernelniveau er der to måder: TileLang for læsning og prototyping mere tilgængelig og CUDA for maksimal ydeevne. Logit-indekskerner (inklusive paginerede varianter) er i DeepGEMM, mens dem med spredt opmærksomhed er udgivet i FlashMLADenne adskillelse gør det lettere for de forsknings- og produktionsorienterede miljøer at finde deres plads.
Lokal udførelse af DeepSeek-V3.2-Exp og inferensdemoer
DeepSeek tilbyder et arkiv af slutning med en opdateret demo for at komme hurtigt i gang og inspicere arkitekturen. Det første trin er at konvertere Hugging Face-vægtene til det format, der forventes af demoen, definere antallet af eksperter og modelparallelitet.
Eksempelkommandoer til interaktiv konvertering og generering (indstil EXPERTS=256 og MP til antallet af GPU'er): kan bruges som den er i et forberedt miljø.
cd inferens export EXPERTS=256 python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-experts ${EXPERTS} --model-parallel ${MP} export CONFIG=config_671B_v3.2.json torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive
For dem der foretrækker SGLang, der er forberedte billeder og en boot-kommando. Support dækker NVIDIA (H200), AMD (MI350) GPU'er og visse NPU'er med specifikke tags.
# H200 docker pull lmsysorg/sglang:dsv32 # MI350 docker pull lmsysorg/sglang:dsv32-rocm # NPU'er docker pull lmsysorg/sglang:dsv32-a2 docker pull lmsysorg/sglang:dsv32-a3 python -m sglang.launch_server --model deepseek-ai/DeepSeek-V3.2-Exp --tp 8 --dp 8 --page-size 64
Hvis du foretrækker det vLLM, har support fra dag ét. Det er tilrådeligt at gennemgå de officielle opskrifter for opdaterede parametre og optimeringer af hardware.
API: Slutpunkter, kompatibilitet og udløbsdatoer
API af DeepSeek følger standardkonventioner og er kompatibel med populære SDK'er. Som standard bruges basis-URL'en https://api.deepseek.com du sigter mod V3.2-Exp, hvilket forenkler den indledende integration og adgang til reduceret sats.
Til benchmarking er der et midlertidigt slutpunkt for V3.1-Terminus: https://api.deepseek.com/v3.1_terminus_expires_on_20251015Husk udløbsdatoen og -tidspunktet (15. oktober 2025, 15:59 UTC) for at planlægge Benchmarks.
Derudover er der kompatibilitet med økosystemet i AntropiskDu kan bruge basen https://api.deepseek.com/anthropic for interaktioner i Claude-stil, eller den variant, der er knyttet til det midlertidige slutpunkt, hvis du har brug for at sammenligne med den forrige model.
Godkendelse og nøglehåndtering
Anmodninger godkendes af Bærer i Authorization-headeren. Generer din nøgle fra DeepSeek-dashboardet, og gem den sikkert, f.eks. i miljøvariabler eller filhåndteringsværktøjer. hemmelighed som AWS Secrets Manager.
Panelet viser forbrug og fakturering for at kontrollere forbruget af poletterSelvom priserne er faldet, er det tilrådeligt at anvende hastighedsbegrænsning og periodisk nøglerotation på computere, udover at tilbagekalde enhver kompromitteret nøgle Uden forsinkelse.
Chatgennemførelser, skabeloner og grundlæggende anmodninger
Det centrale endepunkt er /chat/fuldførelser, som behandler dialoger med flere vendinger og opretholder kontekst mellem opkald, et ideelt scenarie for V3.2-Exps styrker ved lang kontekst. Der er to typiske modeltilstande: deepseek-chat y deepseek-reasoner.
En simpel anmodningstekst kan se sådan ud, ved hjælp af escaped JSON (her repræsenteret som " for klarhedens skyld): inkluderer en systemprompt og en brugerprompt.
{ "model": "deepseek-chat", "messages": [ { "role": "system", "content": "Du er en teknisk ekspert." }, { "role": "bruger", "content": "Forklar sparsom opmærksomhed." } ], "stream": false }
Når du ønsker svar i realtid, skal du aktivere strøm=sandOverskrifterne skal indeholde Content-Type: application/json og Authorization-tokenet: Bearer ${DEEPSEEK_API_KEY}. Hvis du arbejder med eksplicit ræsonnement, kan du styre adfærden med flaget. ræsonnement.aktiveret.
Responsstruktur og SSE-streaming
Ikke-streamingsvar inkluderer felter som f.eks. id, objekt, oprettet, model, valg og brug. I valg finder du det genererede indhold (rolle: "assistent"), og i brug detaljerne om prompt_tokens, færdiggørelsestokens og total_tokens.
I streamingtilstand sender API'en Server-Sendte hændelserHvert fragment ankommer som en datahændelse med en delta, som du skal akkumulere. Dette er den ideelle mulighed for grænseflader interaktive eller terminaler med inkrementelt output.
Funktionskald og output i strict JSON
Du kan definere værktøjer så modellen bestemmer, hvornår en funktion skal kaldes, for eksempel for at hente data eller udføre handlinger. Dette passer godt til agentflows og integrationer. backend.
Hvis du har brug for struktureret output, skal du fremtvinge JSON-tilstand ved hjælp af response_format. Dette er nyttigt til dataudtrækning eller validering automatisk i rørledninger.
Python-eksempler med OpenAI-stil SDK
Med Python er inputkurven meget jævn. Indstil api_base ligesom DeepSeek, definere nøglen og startforespørgsler; du kan skifte mellem standard- og streamingtilstand afhængigt af dit brugstilfælde.
import openai openai.api_base = "https://api.deepseek.com" openai.api_key = "your_api_key_here" response = openai.ChatCompletion.create( model="deepseek-chat", messages=[ {"role": "system", "content": "Du er en kodeassistent."}, {"role": "bruger", "content": "Skriv en Python-funktion til at beregne Fibonacci-tal."} ], stream=False ) print(response.choices[0].message.content) # Streaming stream = openai.ChatCompletion.create(model="deepseek-chat", messages=[...], stream=True) for chunk in stream: if chunk.choices[0].delta.content is not None: print(chunk.choices[0].delta.content, end="") # Funktionskald (værktøjsdefinition) tools = [ { "type": "function", "function": { "name": "get_weather", "description": "Hent aktuelt vejr", "parametre": { "type": "objekt", "egenskaber": { "placering": {"type": "streng"} }, "påkrævet": [ "placering" ] } } } ]
For streng JSON-output, sæt svarformat en {"type": "json_object"}. Og hvis du skal have lange dialoger, så husk at gå indsnævring af konteksten for at holde dig inden for grænserne og maksimere effektiviteten.
Integration med Apidog
Apidog accelererer prototyping Tilbagekald: Importér specifikationer, gem miljøvariabler (f.eks. nøglen), byg POST'er og test undervejs. Dens responssimulator gør det nemt at teste ekstreme tilfælde uden ekstra omkostninger. poletter.
Den genererer også kodestykker i forskellige idiomer og tilbyder en tidslinjevisning til fejlfinding af godkendelse eller parametre. Da V3.2-Exp håndterer brede kontekster, er Apidog en god måde at eksperimentere med lange prompts og se ydeevne.
Gode vaner for at få mest muligt ud af det
Definer systemprompter klar og præcis der afgrænser adfærd. Ved komplekse problemer kan ræsonnementsmetoden hjælpe, kombineret med tankestruktureringsteknikker, der er passende til din sag.
Administrer sammenhæng med head: Selvom V3.2-Exp tolererer lang kontekst (sager op til 128K er citeret), kan overdreven historik straffe effektiviteten. Den implementerer smart trunkering, skjult til hyppige og batchforespørgsler, hvor det giver mening.
Inden for sikkerhed renser den input for at forhindre hurtige injektioner og logger interaktioner til revisionJuster temperatur og top_p i henhold til dit mål: lave værdier for determinisme, høje værdier for kreativitet.
Udfør A/B-tests mellem deepseek-chat y deepseek-reasoner at vælge den optimale tilstand. Og husk hastighedsgrænsen for at undgå overraskelser i fakturering.
Sammenligning med V3.1-Terminus
Indførelsen af DSA medfører forbedringer i latens som i nogle scenarier nærmer sig 3x hastighed uden at ofre den samlede kvalitetsparitet. Det er en udvikling med fokus på forholdet effekt/effektivitet mere end i nøjagtighedsregistreringer.
De små stigninger i kodning og små fald inden for humanistiske områder afspejler finjusteringen af en model, der per design er eksperimenterendeDet tidsmæssige endepunkt for V3.1 muliggør direkte sammenligninger, der viser DSA-gevinster på lang sigt.
Avanceret lokal implementering
For privatlivsfølsomme eller offline implementeringer, download pesos fra Hugging Face og brug af de officielle konverteringsskripter er vejen frem. Indstil antallet af eksperter (f.eks. 256) og juster modellens parallelitet til dine behov. GPU'er.
Inferensdemoen tillader testning i interaktiv tilstand, og kernerne i TileLang eller CUDA vil hjælpe dig med at presse ydeevnen i henhold til prioriteter: prototypehastighed eller maksimal gennemstrømning i produktion.
Åbne kerner og ydeevne
TileLang prioriterer læsbarhed og design til forskning, så du hurtigt kan iterere videre på nye ideer. Det er perfekt, hvis du udforsker plejevarianter. spredt eller hukommelsesoptimeringer.
For at presse hvert millisekund ind, kommer CUDA-kerner i spil: logit-indekser (med paginerede versioner) er i DeepGEMM, mens de med spredt opmærksomhed lever i FlashMLADenne segmentering giver hvert hold mulighed for at vælge stable optimalt uden at skulle lave arbejdet om.
DeepSeek-V3.2-Exp-licens, aftale og kontakt
Lagerpladsen og pesos Modellen er udgivet under MIT-licensen. Dette åbner døren for kommerciel anvendelse med stor fleksibilitet, hvilket fremmer adoption og innovation i økosystemet.
For at referere til V3.2-Exp i job, leverer DeepSeek en aftaleindtastning af typen @misc med titlen «DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse Attention» og forfatterskabet «DeepSeek-AI» (år 2025). Ved spørgsmål eller hændelser er kontakt-e-mailadressen [e-mail beskyttet].
Officielle ressourcer og nyttige links om DeepSeek-V3.2-Exp
Hvis du vil downloade modellen, har du den i Knusende ansigtHvidbogen findes på GitHub sammen med implementeringsdetaljer og vurderinger.
For sammenligningstests mellem V3.2-Exp og V3.1-Terminus, se Officiel guideOg hvis du vil sende forslag, har du en kanal med tilbagemeldinger offentlig på https://feedback.deepseek.com/dsa.
Med V3.2-Exp prioriterer DeepSeek en simpel idé: effektivitet uden at gå på kompromis med kvalitetenDSA baner vejen for modeller, der understøtter massive kontekster til en rimelig pris, den strømlinede API bringer disse muligheder til flere teams, og stakkens åbenhed (vægte, kerner og dokumentation) gør det lettere for fællesskabet at undersøge, sammenligne og bygge rigtige produkter uden friktion.