Apple julkaisi LensVLM-9B:n Hugging Facessa

0

Apple on julkaissut Hugging Face -alustalla LensVLM-9B-mallin, joka on hienosäädetty versio Alibaban Qwen-tiimin Qwen3.5-9B-Base-mallista. Malli muuttaa pitkät dokumentit pieniksi sivukuviksi, jotta tokenien määrä pysyy kurissa, ja hakee täyden tekstin vain niistä sivuista, jotka vastaavat käyttäjän kysymykseen.

aiuutiset.fi — Tekoälyuutiset suomeksi

Apple on julkaissut Hugging Face -alustalla LensVLM-9B-mallin, joka on hienosäädetty versio Alibaban Qwen-tiimin Qwen3.5-9B-Base-mallista. Malli muuttaa pitkät dokumentit pieniksi sivukuviksi, jotta tokenien määrä pysyy kurissa, ja hakee täyden tekstin vain niistä sivuista, jotka vastaavat käyttäjän kysymykseen.

Mitä julkaistiin ja milloin

Hugging Facen mallikortin mukaan mallin tunnus on apple/LensVLM-9B. Hugging Facen rajapinnan mukaan malli luotiin 21.9.2026 kello 21.18 Suomen aikaa ja sitä päivitettiin viimeksi 23.9.2026 kello 00.06. Mallikortti kuvaa LensVLM:ää 9 miljardin parametrin vision-language-malliksi (VLM), joka skannaa tekstin tiivistettyjä kuvia ja laajentaa valikoivasti vain relevantit sivut takaisin tiivistämättömään muotoon opittujen työkalujen avulla.

Taustalla on Applen Machine Learning Research -sivuston paperi “LensVLM: Selective Context Expansion for Compressed Visual Representation of Text”, jonka sisältötyypiksi on merkitty paper ja julkaisukuukaudeksi heinäkuu 2026. Kirjoittajina ovat Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod ja Bhuwan Dhingra. Xie ja Dhingra on merkitty myös Duke Universityn yhteyteen. Paperin arXiv-tunnus on 2605.07019.

Hugging Facen mallikortti viittaa myös koodivarastoon. Demo-skriptissä voi antaa tiivistyssuhteeksi esimerkiksi 5x, 10x tai 15x.

Mitä finetune, token, Hugging Face ja Qwen tarkoittavat

Finetune eli hienosäätö tarkoittaa, että valmista perusmallia koulutetaan edelleen tiettyyn tehtävään. Tässä tapauksessa Qwen3.5-9B-Baseen on opetettu sivukuvien skannaus ja Expand-työkalun käyttö.

Token on tekstin pieni käsittelyyksikkö mallille, esimerkiksi sana tai sanan osa. Mitä enemmän tokenia kontekstiin mahtuu, sitä pidempiä dokumentteja malli voi käsitellä kerralla – mutta laskenta ja muisti kasvavat nopeasti.

Hugging Face on avoin alusta, jolla julkaistaan ja jaetaan koneoppimismalleja, datasettejä ja dokumentaatiota. Qwen on Alibaban Qwen-tiimin malliperhe; Qwen3.5-9B-Base on noin 9 miljardin parametrin multimodalinen perusmalli, jonka päälle LensVLM on rakennettu.

Kontekstikkuna tarkoittaa sitä, kuinka paljon syötettä malli voi pitää kerralla “muistissaan” yhden kyselyn aikana. Pitkät dokumentit täyttävät kontekstikkunan nopeasti, jos koko teksti syötetään tokenina.

Miten sivukuva-temppu toimii

Paperin mukaan teksti renderöidään sivukuviksi. Vision-enkooderi muuttaa jokaisen kiinteäkokoisen kuvan kiinteäksi määräksi visuaalisia tokeneita. Kun renderöinnin resoluutiota madalletaan, samaan tokenimäärään mahtuu enemmän tekstiä. Tutkijat kutsuvat tätä syötteen tiivistyssuhteeksi (input compression rate, ICR). Käytännön demoissa käytetään 5-, 10- ja 15-kertaisia tiivistysasetuksia.

Pelkkä tiivistettyjen kuvien lukeminen ei kuitenkaan riitä: tarkkuus romahtaa, kun merkit pienenevät vision-enkooderin erotuskyvyn alle. LensVLM ei yritä lukea kaikkea epäselvää tekstiä loppuun asti. Se skannaa ensin tiivistetyt sivukuvat, valitsee todennäköisesti relevantit sivut ja kutsuu Expand-työkalua, joka palauttaa valitun sivun tiivistämättömänä – tyypillisesti alkuperäisenä tekstinä tai korkearesoluutioisena kuvana.

Mallikortin mukaan kyseessä on juuri tämä “skannaa tiivistettyjä sivuja, laajenna vain tarvittavat” -käyttäytyminen. Paperissa menetelmää kuvataan inference-kehykseksi ja post-training-reseptiksi: ensin valvottu hienosäätö (SFT) synteettisillä työkalujäljillä, sitten vahvistusoppiminen (RL).

Mitä säästöjä väitetään

Applen tutkimustiivistelmän ja paperin mukaan LensVLM säilyttää seitsemässä tekstivastausbenchmarkissa tarkkuuden, joka on verrattavissa täyden tekstin ylärajaan noin 4,3-kertaisella efektiivisellä tiivistyssuhteella (effective compression rate, ECR). ECR mittaa, kuinka monella tokenilla lukija-malli lopulta käsittelee alkuperäiseen tekstipituuteen nähden, kun mukaan lasketaan myös Expand-kutsujen palauttamat tokenit.

Samoissa testeissä malli voittaa retrieval-, teksti- ja visuaalitiivistysvertailut jopa noin 10,1-kertaisella efektiivisellä tiivistyssuhteella. Paperin tehokkuusanalyysin mukaan KV-välimuistin (mallin sisäisen avain-arvo-välimuistin) huippukuorma voi laskea esimerkiksi noin 78,6 prosenttia 20 sivukuvan asetuksella ja noin 84,2 prosenttia 100 sivukuvan asetuksella verrattuna täyden tekstin syöttöön. Haittapuolena mainitaan viive: tyypillinen Expand-kutsu tekee päätelystä monivaiheisen.

Paperin mukaan menetelmä yleistyy myös multimodalisiin dokumentteihin ja koodin ymmärtämiseen. Renderöidylle tekstille tekstilaajennus on yleensä parempi; natiiville PDF-tyyppiselle dokumentille korkearesoluutioinen zoom voi säilyttää tärkeitä asetteluvinkkejä.

Lisenssi ja käyttöehdot

Hugging Facen mallikortin ja LICENSE-tiedoston mukaan mallipainot ja Applen Qwen-muutokset julkaistaan Apple Machine Learning Research Model License -lisenssillä. Lisenssi on henkilökohtainen, ei-yksinomainen, ei-siirrettävä ja maksuton, mutta se rajaa käytön Research Purposes -tarkoitukseen eli ei-kaupalliseen tieteelliseen tutkimukseen. Kaupallinen tuotekäyttö ei kuulu lisenssin piiriin. Lähdekoodi jaetaan erikseen Apple Sample Code License -ehdoilla.

Tämä on tärkeä ero moniin avoimiin mallijulkaisuihin: painot ovat ladattavissa tutkimukseen, mutta ei automaattisesti vapaaseen kaupalliseen käyttöön.

Mitä tieto ei kerro

Kirjoitushetkellä ei löytynyt laajaa, itsenäistä TechCrunchin, The Vergen tai Ars Technican uutisointia juuri Hugging Face -julkaisusta. Uutiskärki nojaa viralliseen mallikorttiin, Applen tutkimuspaperiin, arXiv-versioon ja Hugging Facen metadataan. Pivot News käsitteli paperia jo 7.7.2026, eli ennen mallipainojen syyskuun julkaisua. Artikkelissa ei arvioida, tuleeko tekniikkaa Applen kuluttajatuotteisiin.

Lähteet

Leave a Reply

Pakolliset kentät on merkitty *

Share with