Infrastruktur Digio

Model AI & GPU

Jalankan agen pada model frontier terkelola sekarang—atau sewa kapasitas GPU, terapkan bobot Anda sendiri, dan arahkan tugas Digio ke titik akhir privat di ruang kerja yang sama.

Label UI situs web SaaS B2B. Terjemahkan ke id alami: Claude, GPT, Gemini Pilihan model per agen Penyewaan GPU & BYOM
Model yang dikelola

Model tersedia di Digio saat ini

Tetapkan model default per agen atau ganti per tugas. Penggunaan diukur dalam Token Digio dari saldo paket Anda—dompet yang sama baik agen memanggil Sonnet, GPT-4o, atau Gemini Flash.

Claude antropis

  • Claude Opus 4.7 Penalaran andalan, konteks panjang, arsitektur dan strategi bekerja.
  • Claude Opus 4.6 Opus generasi sebelumnya untuk analisis yang stabil dan berkualitas tinggi.
  • Claude Sonnet 4.6 Penggerak harian—coding, penulisan, dan loop agen multi-langkah.
  • Claude Sonnet 4.5 / 4 Tingkat Sonnet cepat dengan caching cepat pada beban kerja yang didukung.
  • Claude Haiku 4.5 Draf latensi rendah, klasifikasi, dan subtugas bervolume tinggi.

Label UI situs web SaaS B2B. Terjemahkan ke id alami: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Rangkaian GPT-5 terbaru untuk beban kerja umum dan agen.
  • GPT-4.1 & GPT-4o Obrolan multimodal dan penggunaan alat yang andal untuk agen produksi.
  • GPT-4o mini Perutean hemat biaya untuk ringkasan dan langkah-langkah ringan.
  • o3 / o3-pro / o3-mini / o4-mini Model yang berfokus pada penalaran untuk matematika, perencanaan, dan verifikasi.
  • GPT-5.3 Codex & Codex mini Keterampilan pembuatan kode, pemfaktoran ulang, dan agen yang sadar repo.

Label UI situs web SaaS B2B. Terjemahkan ke id alami: Google Gemini

  • Gemini 2.5 Pro Penelitian konteks panjang dan ekstraksi terstruktur.
  • Gemini 2.5 Flash Langkah agen dengan throughput tinggi dengan harga token yang kompetitif.
  • Gemini 2.0 Flash Pass ultra-cepat untuk pekerjaan penguraian, penandaan, dan batch.

API terbuka & khusus

  • DeepSeek Chat & Reasoner Nilai yang kuat untuk obrolan dan tugas gaya rantai pemikiran.
  • Mistral Large Opsi yang dihosting di Eropa untuk tim agen multibahasa.
  • Llama 3.3 70B Model kelas bobot terbuka melalui API—cocok dipadukan dengan GPU pribadi.
  • Grok 3 Model berorientasi waktu nyata untuk agen berita dan pemantauan sosial.
  • Sonar Pro Jawaban berdasarkan pencarian untuk agen penelitian.
  • Command R+ Alur kerja obrolan dan pengambilan perusahaan yang ramah RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Penggunaan

Bagaimana agen memilih model

Koordinator dapat merekomendasikan Sonnet vs Opus vs model flash yang lebih murah berdasarkan jenis tugas. Pengguna tingkat lanjut menetapkan default per peran agen—penelitian di Sonnet, tinjauan akhir di Opus, penandaan massal di Haiku atau Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Penyewaan GPU

Sewa GPU dan jalankan model Anda sendiri

Butuh penyesuaian, pos pemeriksaan dengan celah udara, atau harga inferensi yang dapat diprediksi? Tambahkan kapasitas GPU khusus ke ruang kerja Digio Anda, instal tumpukan penyajian yang Anda inginkan, dan titik agen di titik akhir pribadi Anda.

Contoh khusus

Node GPU per jam atau bulanan (kelas A100, H100, L40S) yang melekat pada penyewa Anda—terisolasi dari pelanggan lain.

beban Anda

Unggah safetensor, GGUF, atau tarik dari registri Anda; jalankan Llama, Mistral, Qwen, dan penyesuaian khusus.

Penyajian standar

vLLM, TGI, Ollama, atau gambar kontainer yang Anda kelola—Agen Digio memanggil URL dasar yang kompatibel dengan OpenAI.

Orkestrasi yang sama

Yang harus dilakukan, obrolan tim, keterampilan, dan kolaborasi tidak berubah—hanya backend inferensi yang menjadi milik Anda.

Perutean hibrid

Kirim langkah sensitif ke GPU pribadi dan gunakan Claude atau GPT untuk riset publik dalam satu alur kerja.

Kontrol perusahaan

Peering VPC, jalan keluar statis, log audit, dan daftar model yang diizinkan untuk tim yang teregulasi.

Bawalah model Anda sendiri

Instal dan sambungkan model khusus

Penyiapan umum dari nol hingga agen memanggil titik akhir Anda:

  1. Cadangan GPU

    Pilih VRAM, wilayah, dan waktu aktif (burst vs selalu aktif). Penyimpanan untuk beban dikirimkan bersama instance atau dipasang di bucket Anda.

  2. Sebarkan tumpukan

    Mulai gambar penyajian atau SSH, instal driver CUDA, dan muat pos pemeriksaan. Pemeriksaan kesehatan mengonfirmasi bahwa model sudah siap.

  3. Daftarkan titik akhir

    Tambahkan URL dasar, kunci API, dan id model di pengaturan ruang kerja. Digio memvalidasi latensi dan format token sebelum ditayangkan.

  4. Tetapkan ke agen

    Pilih model pribadi Anda sebagai default untuk agen yang dipilih; model Claude/GPT yang dikelola tetap tersedia secara berdampingan.

Sewa GPU ditagih secara terpisah dari langganan paket Digio. Hubungi kami untuk perencanaan kapasitas, SLA, dan migrasi dari kluster inferensi yang ada.

Pertanyaan Umum

Pertanyaan model & GPU

Memilih API terkelola vs inferensi yang dihosting sendiri di Digio.

Apakah saya membayar dua kali—paket plus API?

Langganan Digio Anda mencakup infrastruktur, agen, dan termasuk Token Digio. Penggunaan model terkelola mendebit saldo token tersebut dengan token input/output aktual. Penyewaan GPU adalah tambahan untuk mesin yang Anda kendalikan.

Bisakah agen yang berbeda menggunakan model yang berbeda?

Ya—setiap agen dapat memiliki defaultnya sendiri. Tugas dan obrolan dapat ditimpa untuk sekali proses tanpa mengubah default global.

Apa perbedaan antara Soneta dan Opus?

Opus disesuaikan dengan penalaran yang lebih sulit dan rencana yang lebih koheren; Sonnet lebih cepat dan lebih murah untuk loop agen sehari-hari. Model kelas Haiku dan flash adalah yang terbaik untuk subtugas volume.

Bisakah saya hanya menjalankan model saya sendiri dan memblokir API cloud?

Ruang kerja perusahaan dapat membatasi penyedia model keluar dan merutekan semua lalu lintas agen ke titik akhir GPU Anda. Mode hybrid adalah default untuk sebagian besar tim.

Ukuran GPU apa yang tersedia?

Penawaran bergantung pada wilayah dan permintaan—umumnya tingkat VRAM 24–80 GB untuk model kelas 7B–70B dan node multi-GPU untuk tumpukan yang lebih besar. Kami membantu mengukur VRAM dari jumlah parameter dan kuantisasi Anda.

Apakah penggunaan GPU pribadi masih menggunakan Token Digio?

Orkestrasi (agen, tugas, penyimpanan) tetap sesuai rencana Anda. Inferensi pada GPU Anda dihitung sebagai waktu GPU; Anda juga dapat mengukur penggunaan berbentuk token untuk tagihan balik internal.

Pilih model terkelola atau bawa GPU Anda

Mulai dengan Claude dan GPT sekarang, lalu tambahkan GPU khusus saat Anda siap menghosting bobot khusus—agen yang sama, tugas yang sama, inferensi Anda.