Yhdysvaltalainen tekoäly-yhtiö PrismML julkaisi 17. syyskuuta Bonsai 2 27B -mallin, jossa Alibaban Qwen3.8 27B -kielimalli on pakattu niin sanottuihin ternäärisiin painoihin. Malli vie 5,9 gigatavua muistia eli yli yhdeksän kertaa vähemmän kuin täystarkkuuksinen esikuvansa, mutta säilyttää yhtiön mukaan 98,2 prosenttia sen yhteenlasketuista vertailutuloksista. Kyse on yhdestä nopeimmin edenneistä askelista matalan bittisyvyyden mallien kilpailussa, jossa tekoälyä pyritään ajamaan paikallisesti tietokoneella ja puhelimella.

Mitä PrismML julkaisi

Bonsai 2 27B perustuu Qwen3.8 27B -malliin, jonka arkkitehtuuriin ei ole koskettu: malli on edelleen 27,8 miljardin parametrin multimodaalinen kielimalli, jossa on noin 262 000 tokenin konteksti-ikkuna. Muutos koskee painojen esitystapaa. Kun tavallinen malli tallentaa jokaisen painon 16 bitillä, Bonsain painot saavat vain kolme arvoa: +1, 0 tai −1. Ryhmäkohtaisella FP16-skaalauksella päästään yhtiön mukaan 1,76 efektiiviseen bittiin painoa kohden, ja koko mallin koko on 5,9 gigatavua täystarkkuuksisen version noin 54 gigatavusta.

Yhtiön mukaan ternäärinen esitys on viety läpi koko kielimallista – upotuksista ja huomioprojektioista MLP-projektioihin ja lähtöpäähän asti. Kuvatulo kulkee erillisen noin 0,63 gigatavun näköpaketin kautta, ja malli on julkaistu Apache 2.0 -lisenssillä.

Miten hyvin malli säilyttää laatunsa

PrismML mittasi mallia 20 tehtävän sarjalla, joka kattaa päättelyn, matematiikan, koodauksen, ohjeiden noudattamisen, kuvanymmärryksen ja työkalujen käytön. Bonsai 2 27B sai yhteenlasketuksi tulokseksi 83,9 pistettä, kun täystarkkuuksinen Qwen3.8 27B ylsi 85,4 pisteeseen. Ero on 1,5 pistettä, eli 98,2 prosenttia vertailukohdan tuloksesta.

Edellinen Bonsai 27B ylsi 95 prosenttiin täystarkkuuksisen mallin tuloksista, joten kahdessa kuukaudessa laadullinen ero on kaventunut selvästi. Yhtiön mallikortin mukaan koodaus pysyy täystarkkuuksisen mallin tasolla ja matematiikassa jäätiin puolen pisteen päähän, kun taas kuvanymmärrys ja työkalujen käyttö heikkenevät hieman enemmän.

Nopeus ja energiankulutus

PrismML ilmoittaa mallin nopeudeksi jopa 143 tokenia sekunnissa Nvidian GeForce RTX 5090 -näytönohjaimella ja 46,8 tokenia sekunnissa Applen M5 Max -kannettavalla. RTX 4090 -kortilla malli kuluttaa yhtiön mukaan 0,714 milliwattituntia tokenia kohden, mikä on 40 prosenttia vähemmän kuin täystarkkuuksinen kahdeksan miljardin parametrin malli.

Käytännössä luvut tarkoittavat sitä, että 27 miljardin parametrin luokan malli pyörii tavallisella kannettavalla tai yhdellä kuluttajatason näytönohjaimella. PrismML markkinoi mallia paikallisiin avustajiin, koodausagentteihin, dokumenttien analysointiin ja pitkäkestoisiin agenttitehtäviin, jotka on tähän asti hoidettu pilvipalveluissa.

Missä malli toimii – ja missä ei

Painot ovat saatavilla heti Apache 2.0 -lisenssillä, ja malli tukee Nvidian näytönohjaimia CUDA-rajapinnan kautta sekä Applen laitteita MLX-rajapinnan kautta. Mukana ovat omat matalan bittisyvyyden ytimet PrismML:n llama.cpp- ja MLX-haaroissa, eli malli vaatii toimiakseen yhtiön oman ajonaikaisen toteutuksen.

Tämä on herättänyt myös kriittistä keskustelua: esimerkiksi Hugging Facen keskusteluissa ja kehittäjäprojekteissa on huomautettu, että ternäärinen pakkaus ei toimi suoraan vakio-llama.cpp:ssä tai sen päällä rakennetuissa työkaluissa ilman erillisiä ytimiä.

Yhtiön tausta ja seuraavat askeleet

PrismML:n perustivat Caltechin tutkijat, ja yhtiötä johtaa Caltechin professori Babak Hassibi. Neuvonantajiin kuuluu Databricksin toinen perustaja ja Berkeleyn Sky Computing Labin johtaja Ion Stoica. Yhtiön tukijoina mainitaan Khosla Ventures, Cerberus ja Google sekä jatkuvana tukijana Samsung. TechCrunchin mukaan yhtiö on kerännyt 22,25 miljoonan dollarin siemenrahoituksen, ja sen on kerrottu neuvotelleen Applen kanssa – toimitusjohtaja ei kommentoinut väitettä toimittajille.

Hassibi kertoi TechCrunchille, että yhtiön seuraavat mallit ovat useiden satojen miljardien parametrien luokassa ja niiden odotetaan säilyttävän alkuperäisen mallin kyvyt ternäärisenä helpommin kuin pienten mallien. Ensimmäinen Bonsai 27B on jo ladattu yli 11 miljoonaa kertaa ja yhtiön pienemmät mallit lisäksi 2,6 miljoonaa kertaa.

PrismML ei ole ainoa pakkaamiseen keskittyvä yhtiö – esimerkiksi Multiverse Computing on kerännyt alalla merkittävää rahoitusta. Ratkaisevaa on, kumpi pystyy pitämään mallin laadun ennallaan samalla kun muistin tarve romahtaa.

Lähteet

  • PrismML: Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, 17.9.2026. prismml.com
  • PR Newswire: PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet, 17.9.2026. prnewswire.com
  • TechCrunch: PrismML hopes its tiny LLM will change how we all use AI, 17.9.2026. techcrunch.com
  • Hugging Face: prism-ml/Ternary-Bonsai-2-27B-gguf (mallikortti), 17.9.2026. huggingface.co
  • GIGAZINE: The ’Ternary Bonsai 2 27B’ is an AI model that reduces the size of the Qwen3.8 27B to 5.9GB while maintaining 98.2% of its performance, 18.9.2026. gigazine.net
  • Complete AI Training: PrismML shrinks AI reasoning models to fit on phones and PCs, 18.9.2026. completeaitraining.com

Vastaa

Pakolliset kentät on merkitty *

Share with