# Atviras kodas: programos, ASR ir LLM modeliai | Digisensus

> Nemokama skambučių įrašymo programa Mac, lietuvių šnekos atpažinimo ir LLM modeliai bei lietuvių šnekos duomenų rinkiniai. Nemokamai, su išeities kodu.

Atviras kodas

# Atvirojo kodo programos, modeliai ir duomenų rinkiniai

Dalijamės tuo, ką sukuriame pakeliui: nemokama skambučių įrašymo programa Mac kompiuteriui, mūsų derinamais šnekos ir kalbos modeliais bei lietuvių šnekos duomenimis, kuriuos paruošiame jiems mokyti. Viską čia galima naudoti nemokamai pagal nurodytą licenciją.

[Programos](#apps) [LLM modeliai](#llm-models) [ASR modeliai](#asr-models) [Duomenų rinkiniai](#datasets)

## Programos

1 projektas

Programos, kurias galite įdiegti ir naudoti jau šiandien, su visu išeities kodu.

### [Digisensus Recorder](/lt/skambuciu-irasymas/)

Digisensus/digisensus-recorder

GPL-3.0

Nemokama skambučių įrašymo programa ir DI susitikimų užrašai Mac kompiuteriui. Įrašo Zoom, Google Meet, Microsoft Teams, FaceTime, WhatsApp ir telefono skambučius be jokio boto pokalbyje, o transkripcijose matyti, kas ką pasakė.

-   Įrašai lieka jūsų Mac kompiuteryje
-   macOS 15 ar naujesnė, Apple silicon

[Funkcijos ir ekrano vaizdai](/lt/skambuciu-irasymas/) [Atsisiųsti Mac](https://recorder.digisensus.com/download) [GitHub](https://github.com/Digisensus/digisensus-recorder)

## LLM modeliai

1 projektas

Dideli kalbos modeliai, kuriuos deriname ir kvantuojame savo GPU klasteriui, kartu su jų paleidimo nustatymais.

### Qwen3.8 27B Digisensus NVFP4

Digisensus/Qwen3.8-27B-Digisensus-NVFP4-RTX5090-256K

Apache-2.0

Qwen3.8-27B viename RTX 5090 su visu 256K žetonų kontekstu. Kiekviena tinklo dalis gauna jai reikalingą tikslumą, todėl tame pačiame atminties kiekyje modelis lieka artimesnis originalui.

-   Apie 115 žetonų per sekundę vienam naudotojui
-   24,5 % artimesnis originalui nei kitas RTX 5090 pritaikytas NVFP4 kvantas
-   Skirtas įrankių kvietimui, JSON atsakymams ir samprotavimui

[🤗 Hugging Face](https://huggingface.co/Digisensus/Qwen3.8-27B-Digisensus-NVFP4-RTX5090-256K) [GitHub](https://github.com/Digisensus/Qwen3.8-27B-Digisensus-NVFP4-RTX5090-256K)

## ASR modeliai

1 projektas

Lietuvių kalbai pritaikyti šnekos atpažinimo (kalbos į tekstą) modeliai su sąžiningais rezultatais atidėtuose ir realių pokalbių testuose.

### Parakeet Lithuanian Phone 0.6B

Digisensus/parakeet-tdt-0.6b-lt-phone

CC-BY-4.0

Lietuviškos telefoninės šnekos atpažinimas, papildomai apmokytas iš NVIDIA Parakeet TDT 0.6B v3 su 426 valandomis skambučių. Rašo skaitomą tekstą: skyrybą, didžiąsias raides, skaičius, datas ir sumas skaitmenimis.

-   Žodžių klaidų dažnis 12,4 % atidėtoje LIEPA-3 telefoninėje šnekoje (buvo 42,7 %)
-   39,3 % nepriklausomuose realiuose skambučiuose (buvo 59,5 %): tyrimų versija, dar ne gamybinei aplinkai

[🤗 Hugging Face](https://huggingface.co/Digisensus/parakeet-tdt-0.6b-lt-phone)

## Duomenų rinkiniai

2 projektai

Lietuvių šnekos duomenų rinkiniai iš atvirai licencijuoto LIEPA-3 tekstyno, su rašytinės formos transkripcijomis, kad modeliai išmoktų rašyti skaitomą tekstą.

### Lithuanian Phone Speech 429 h

Digisensus/lithuanian-phone-speech-liepa-3-429h-punctuated

CC-BY-4.0

429 valandos ir 417 000 spontaninės lietuviškos telefoninės šnekos ištarų. Mūsų žiniomis, didžiausias atvirai licencijuotas lietuviškos telefoninės šnekos rinkinys su rašytinės formos transkripcijomis.

-   Rašytinės formos ir normalizuotos transkripcijos greta
-   16 kHz garsas Parquet formatu, su mokymo, validavimo ir testavimo dalimis

[🤗 Hugging Face](https://huggingface.co/datasets/Digisensus/lithuanian-phone-speech-liepa-3-429h-punctuated)

### Lithuanian Dialect Speech 100 h

Digisensus/lithuanian-dialect-speech-liepa-3-100h-punctuated

CC-BY-4.0

100,5 valandos ir 111 970 spontaninės tarmiškos šnekos ištarų iš 117 kalbėtojų Aukštaitijoje, Žemaitijoje, Dzūkijoje ir Suvalkijoje, tarmiškos žodžių formos išlaikytos kaip ištartos.

-   Trys transkripcijos kiekvienam įrašui: rašytinė, normalizuota ir fonetinė su kirčiais
-   Kalbėtojo ID ir regionas kiekvienam įrašui

[🤗 Hugging Face](https://huggingface.co/datasets/Digisensus/lithuanian-dialect-speech-liepa-3-100h-punctuated)

## Kodėl skelbiame

Mažesnių kalbų šnekos technologijos tobulėja greičiau, kai duomenimis ir modeliais dalijamasi. Skelbiame tai, ką galime, įskaitant rezultatus, rodančius, kur modeliui dar trūksta, kad kiti galėtų tuo remtis ir patikrinti mūsų darbą.

[github.com/Digisensus](https://github.com/Digisensus/) [🤗huggingface.co/Digisensus](https://huggingface.co/Digisensus)

---

- Canonical: https://digisensus.com/lt/atviras-kodas/
- Versija anglų kalba: https://digisensus.com/open-source/
- Book a demo: https://calendar.app.google/MM4rtjEa8ctThvoZ8
- Contact: saulius@digisensus.com · +370 620 69969
