- DiffusionGemma menggantikan penjanaan token berjujukan dengan sistem penyebaran yang mencipta blok teks secara selari.
- Ia menggunakan seni bina MoE parameter 26B yang dioptimumkan untuk berjalan pada perkakasan rumah dengan 18 GB VRAM.
- Ia menyokong input teks, imej dan video berbilang modal, menawarkan kelajuan inferens sehingga 4 kali lebih pantas dalam persekitaran setempat.
- Ia tersedia di bawah lesen Apache 2.0 pada platform seperti Hugging Face dan Vertex AI untuk pelaksanaan percuma.
Anda mungkin pernah mendengar tentang kecerdasan buatan yang menulis perkataan satu demi satu, seolah-olah ia sedang berfikir dengan kuat semasa menaip. Google DeepMind telah memutuskan untuk memecahkan norma itu dan telah melancarkan DiffusionGemma , model eksperimen yang meninggalkan proses berjujukan dan memilih sesuatu yang jauh lebih mengganggu dan pantas.
Projek ini bukanlah kemas kini yang mudah; ia mencadangkan anjakan paradigma. Daripada meneka token seterusnya, DiffusionGemma menggunakan teknik penyebaran , sangat serupa dengan yang digunakan oleh alat seperti Stable Diffusion untuk mencipta imej, tetapi digunakan pada bahasa semula jadi untuk mencapai kecekapan yang mengejutkan.
Bagaimanakah sistem penyebaran teks ini sebenarnya berfungsi?
Bayangkan, daripada menggunakan mesin taip, kita mempunyai mesin cetak yang mampu menghasilkan keseluruhan blok teks dalam satu hantaran. Begitulah cara pasukan Google menerangkan proses tersebut. Model ini bermula dengan kanvas token rawak (pada asasnya hingar) dan, melalui proses pengurangan hingar berulang, memperhalusi maklumat sehingga teks tersebut koheren dan tepat.
Tidak seperti model autoregresif tradisional, yang mengalami kesesakan lebar jalur memori, DiffusionGemma menjana blok 256 token secara serentak . Ini bermakna ia memanfaatkan kuasa pengkomputeran mentah perkakasan dan bukannya menunggu memori menghantar data satu persatu, menghasilkan masa tindak balas yang jauh lebih pantas.
Salah satu keistimewaan sistem ini ialah perhatian dwiarah . Dengan memproses keseluruhan blok, setiap perkataan boleh "melihat" semua yang lain secara serentak. Keupayaan ini merupakan satu kelebihan sebenar untuk tugasan tak linear, seperti menulis kod pengaturcaraan atau menyelesaikan graf matematik , di mana konteks keseluruhan adalah penting.
Seni bina teknikal dan keupayaan multimodal
Teras model ini ialah seni bina Campuran Pakar (MoE) 26B , yang mana hanya 4B parameter yang aktif pada satu-satu masa. Ini membolehkan sistem melakukan penaakulan mendalam tanpa membebankan komputer, sekali gus meminimumkan overhed sumber.
Mengenai apa yang boleh "dibaca" olehnya, DiffusionGemma ialah model multimodal. Ia boleh memproses input teks, imej dan video secara asli , menyesuaikan diri dengan resolusi dan nisbah aspek yang berbeza. Walau bagaimanapun, adalah penting untuk ambil perhatian bahawa ia tidak menyokong input audio , memfokuskan potensi penuhnya pada output teks.
Bagi mereka yang gemar mengutak-atik tetapan, model ini merangkumi mod penaakulan yang boleh dikonfigurasikan . Ini membolehkan AI "berfikir" langkah demi langkah sebelum mengeluarkan jawapan akhir, memastikan laluan logik adalah betul sebelum mencetak blok teks.
Pengoptimuman untuk pengguna dan perkakasan setempat
Jika anda lebih suka menjalankan AI di premis dan tidak bergantung pada awan, berikut adalah berita baik. DiffusionGemma telah dioptimumkan untuk GPU pengguna , sesuai dengan selesa dalam 18GB VRAM hasil daripada pengkuantuman. Ia merupakan alat yang ideal untuk mereka yang mahukan kependaman rendah dalam persekitaran setempat.
Untuk mendapatkan prestasi terbaik daripada model ini, Google mengesyorkan konfigurasi persampelan tertentu. Had atas langkah pengurangan hingar ialah 48 , walaupun hasil daripada penghentian adaptif, proses biasanya selesai lebih awal, antara 12 dan 16 langkah bergantung pada kerumitannya.
Satu lagi butiran penting ialah jadual suhu linear , yang bermula pada 0.8 untuk menggalakkan kreativiti dan penerokaan awal, dan berakhir pada 0.4 untuk menutup token akhir dengan tepat. Tambahan pula, ia menggunakan ambang entropi untuk menghentikan pelaksanaan jika model yakin dengan jawapannya, sekali gus mencegah kitaran pengiraan yang sia-sia.
Perbandingan: Kelajuan vs. Kualiti
Bukan semuanya mudah, dan kita perlu realistik: pendekatan ini mengutamakan kelajuan berbanding kesempurnaan mutlak. Dalam ujian prestasi, DiffusionGemma sedikit ketinggalan berbanding model Gemma standard dari segi keupayaan penaakulan tulen . Kita menghadapi dilema yang jelas antara kelajuan ekstrem dan kualiti maksimum.
Walau bagaimanapun, kelebihannya amat ketara dalam perkakasan tempatan. Walaupun model tradisional kurang memanfaatkan GPU dengan memproses token demi token, model ini memaksimumkan prestasi cip dengan mengisi saluran data. Dalam senario tertentu, ia boleh menjadi sehingga empat kali lebih pantas daripada model sebelumnya.
Model ini telah diedarkan di bawah lesen Apache 2.0 , yang bermaksud mana-mana pembangun boleh mengubah suai atau mengkomersialkan aplikasi berdasarkannya. Ia tersedia pada platform seperti Hugging Face, Kaggle dan Vertex AI , dan sokongan penuh untuk pustaka llama.cpp dijangka tidak lama lagi.
Kita sedang menyaksikan perubahan arah di mana kecerdasan tidak lagi bergantung semata-mata pada penciptaan model gergasi, tetapi sebaliknya pada pembinaan seni bina yang lebih cekap . Dengan memproses maklumat secara selari dan mengurangkan pergantungan pada lebar jalur memori, Google telah membuka pintu kepada AI tempatan yang jauh lebih tangkas, menjimatkan dan mudah diakses untuk semua pengguna.
Penulis yang bersemangat tentang dunia bait dan teknologi secara umum. Saya suka berkongsi pengetahuan saya melalui penulisan, dan itulah yang akan saya lakukan dalam blog ini, menunjukkan kepada anda semua perkara yang paling menarik tentang alat, perisian, perkakasan, trend teknologi dan banyak lagi. Matlamat saya adalah untuk membantu anda mengemudi dunia digital dengan cara yang mudah dan menghiburkan.