Apple julkaisi LensVLM-9B:n Hugging Facessa
Apple on julkaissut Hugging Face -alustalla LensVLM-9B-mallin, joka on hienosäädetty versio Alibaban Qwen-tiimin Qwen3.5-9B-Base-mallista. Malli muuttaa pitkät dokumentit pieniksi sivukuviksi, jotta tokenien määrä pysyy kurissa, ja hakee täyden tekstin vain niistä sivuista, jotka vastaavat käyttäjän kysymykseen.
Apple on julkaissut Hugging Face -alustalla LensVLM-9B-mallin, joka on hienosäädetty versio Alibaban Qwen-tiimin Qwen3.5-9B-Base-mallista. Malli muuttaa pitkät dokumentit pieniksi sivukuviksi, jotta tokenien määrä pysyy kurissa, ja hakee täyden tekstin vain niistä sivuista, jotka vastaavat käyttäjän kysymykseen.
Mitä julkaistiin ja milloin
Hugging Facen mallikortin mukaan mallin tunnus on apple/LensVLM-9B. Hugging Facen rajapinnan mukaan malli luotiin 21.9.2026 kello 21.18 Suomen aikaa ja sitä päivitettiin viimeksi 23.9.2026 kello 00.06. Mallikortti kuvaa LensVLM:ää 9 miljardin parametrin vision-language-malliksi (VLM), joka skannaa tekstin tiivistettyjä kuvia ja laajentaa valikoivasti vain relevantit sivut takaisin tiivistämättömään muotoon opittujen työkalujen avulla.
Taustalla on Applen Machine Learning Research -sivuston paperi “LensVLM: Selective Context Expansion for Compressed Visual Representation of Text”, jonka sisältötyypiksi on merkitty paper ja julkaisukuukaudeksi heinäkuu 2026. Kirjoittajina ovat Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod ja Bhuwan Dhingra. Xie ja Dhingra on merkitty myös Duke Universityn yhteyteen. Paperin arXiv-tunnus on 2605.07019.
Hugging Facen mallikortti viittaa myös koodivarastoon. Demo-skriptissä voi antaa tiivistyssuhteeksi esimerkiksi 5x, 10x tai 15x.
Mitä finetune, token, Hugging Face ja Qwen tarkoittavat
Finetune eli hienosäätö tarkoittaa, että valmista perusmallia koulutetaan edelleen tiettyyn tehtävään. Tässä tapauksessa Qwen3.5-9B-Baseen on opetettu sivukuvien skannaus ja Expand-työkalun käyttö.
Token on tekstin pieni käsittelyyksikkö mallille, esimerkiksi sana tai sanan osa. Mitä enemmän tokenia kontekstiin mahtuu, sitä pidempiä dokumentteja malli voi käsitellä kerralla – mutta laskenta ja muisti kasvavat nopeasti.
Hugging Face on avoin alusta, jolla julkaistaan ja jaetaan koneoppimismalleja, datasettejä ja dokumentaatiota. Qwen on Alibaban Qwen-tiimin malliperhe; Qwen3.5-9B-Base on noin 9 miljardin parametrin multimodalinen perusmalli, jonka päälle LensVLM on rakennettu.
Kontekstikkuna tarkoittaa sitä, kuinka paljon syötettä malli voi pitää kerralla “muistissaan” yhden kyselyn aikana. Pitkät dokumentit täyttävät kontekstikkunan nopeasti, jos koko teksti syötetään tokenina.
Miten sivukuva-temppu toimii
Paperin mukaan teksti renderöidään sivukuviksi. Vision-enkooderi muuttaa jokaisen kiinteäkokoisen kuvan kiinteäksi määräksi visuaalisia tokeneita. Kun renderöinnin resoluutiota madalletaan, samaan tokenimäärään mahtuu enemmän tekstiä. Tutkijat kutsuvat tätä syötteen tiivistyssuhteeksi (input compression rate, ICR). Käytännön demoissa käytetään 5-, 10- ja 15-kertaisia tiivistysasetuksia.
Pelkkä tiivistettyjen kuvien lukeminen ei kuitenkaan riitä: tarkkuus romahtaa, kun merkit pienenevät vision-enkooderin erotuskyvyn alle. LensVLM ei yritä lukea kaikkea epäselvää tekstiä loppuun asti. Se skannaa ensin tiivistetyt sivukuvat, valitsee todennäköisesti relevantit sivut ja kutsuu Expand-työkalua, joka palauttaa valitun sivun tiivistämättömänä – tyypillisesti alkuperäisenä tekstinä tai korkearesoluutioisena kuvana.
Mallikortin mukaan kyseessä on juuri tämä “skannaa tiivistettyjä sivuja, laajenna vain tarvittavat” -käyttäytyminen. Paperissa menetelmää kuvataan inference-kehykseksi ja post-training-reseptiksi: ensin valvottu hienosäätö (SFT) synteettisillä työkalujäljillä, sitten vahvistusoppiminen (RL).
Mitä säästöjä väitetään
Applen tutkimustiivistelmän ja paperin mukaan LensVLM säilyttää seitsemässä tekstivastausbenchmarkissa tarkkuuden, joka on verrattavissa täyden tekstin ylärajaan noin 4,3-kertaisella efektiivisellä tiivistyssuhteella (effective compression rate, ECR). ECR mittaa, kuinka monella tokenilla lukija-malli lopulta käsittelee alkuperäiseen tekstipituuteen nähden, kun mukaan lasketaan myös Expand-kutsujen palauttamat tokenit.
Samoissa testeissä malli voittaa retrieval-, teksti- ja visuaalitiivistysvertailut jopa noin 10,1-kertaisella efektiivisellä tiivistyssuhteella. Paperin tehokkuusanalyysin mukaan KV-välimuistin (mallin sisäisen avain-arvo-välimuistin) huippukuorma voi laskea esimerkiksi noin 78,6 prosenttia 20 sivukuvan asetuksella ja noin 84,2 prosenttia 100 sivukuvan asetuksella verrattuna täyden tekstin syöttöön. Haittapuolena mainitaan viive: tyypillinen Expand-kutsu tekee päätelystä monivaiheisen.
Paperin mukaan menetelmä yleistyy myös multimodalisiin dokumentteihin ja koodin ymmärtämiseen. Renderöidylle tekstille tekstilaajennus on yleensä parempi; natiiville PDF-tyyppiselle dokumentille korkearesoluutioinen zoom voi säilyttää tärkeitä asetteluvinkkejä.
Lisenssi ja käyttöehdot
Hugging Facen mallikortin ja LICENSE-tiedoston mukaan mallipainot ja Applen Qwen-muutokset julkaistaan Apple Machine Learning Research Model License -lisenssillä. Lisenssi on henkilökohtainen, ei-yksinomainen, ei-siirrettävä ja maksuton, mutta se rajaa käytön Research Purposes -tarkoitukseen eli ei-kaupalliseen tieteelliseen tutkimukseen. Kaupallinen tuotekäyttö ei kuulu lisenssin piiriin. Lähdekoodi jaetaan erikseen Apple Sample Code License -ehdoilla.
Tämä on tärkeä ero moniin avoimiin mallijulkaisuihin: painot ovat ladattavissa tutkimukseen, mutta ei automaattisesti vapaaseen kaupalliseen käyttöön.
Mitä tieto ei kerro
Kirjoitushetkellä ei löytynyt laajaa, itsenäistä TechCrunchin, The Vergen tai Ars Technican uutisointia juuri Hugging Face -julkaisusta. Uutiskärki nojaa viralliseen mallikorttiin, Applen tutkimuspaperiin, arXiv-versioon ja Hugging Facen metadataan. Pivot News käsitteli paperia jo 7.7.2026, eli ennen mallipainojen syyskuun julkaisua. Artikkelissa ei arvioida, tuleeko tekniikkaa Applen kuluttajatuotteisiin.
Lähteet
- Hugging Face – apple/LensVLM-9B – 21.9.2026 klo 21.18 Europe/Helsinki (luotu; päivitetty 23.9.2026 klo 00.06) – https://huggingface.co/apple/LensVLM-9B
- Apple Machine Learning Research – LensVLM: Selective Context Expansion for Compressed Visual Representation of Text – heinäkuu 2026 – https://machinelearning.apple.com/research/lensvlm-context-expansion
- arXiv – LensVLM: Selective Context Expansion for Compressed Visual Representation of Text (arXiv:2605.07019) – 24.8.2026 – https://arxiv.org/abs/2605.07019
- Hugging Face Papers – LensVLM: Selective Context Expansion for Compressed Visual Representation of Text – 7.5.2026 – https://huggingface.co/papers/2605.07019
- GitHub – apple/ml-lensvlm (Official code for LensVLM) – https://github.com/apple/ml-lensvlm
- Hugging Face – apple/LensVLM-9B LICENSE (Apple Machine Learning Research Model License) – Copyright 2026 Apple Inc. – https://huggingface.co/apple/LensVLM-9B/raw/main/LICENSE
- Pivot News – Apple's LensVLM Enables High-Compression Vision Language Model Inference with Selective Context Expansion – 7.7.2026 – https://pivotnews.ai/design/apples-lensvlm-compression-vlm-inference
- alphaXiv – LensVLM: Selective Context Expansion for Compressed Visual Representation of Text – 7.5.2026 – https://www.alphaxiv.org/abs/2605.07019
