Digio-Infrastruktur

KI-Modelle und GPU

Führen Sie Agenten noch heute auf verwalteten Frontier-Modellen aus – oder mieten Sie GPU-Kapazität, stellen Sie Ihre eigenen Gewichtungen bereit und leiten Sie Digio-Aufgaben an private Endpunkte im selben Arbeitsbereich weiter.

Claude, GPT, Zwillinge Modellauswahl pro Agent GPU-Vermietung und BYOM
Verwaltete Modelle

Modelle, die heute in Digio erhältlich sind

Weisen Sie pro Agent ein Standardmodell zu oder überschreiben Sie es pro Aufgabe. Die Nutzung wird in Digio-Tokens aus Ihrem Planguthaben gemessen – dem gleichen Wallet, egal ob der Agent Sonnet, GPT-4o oder Gemini Flash anruft.

Anthropischer Claude

  • Claude Opus 4.7 Flaggschiff-Argumentation, langer Kontext, Architektur- und Strategiearbeit.
  • Claude Opus 4.6 Opus der vorherigen Generation für stabile, qualitativ hochwertige Analysen.
  • Claude Sonnet 4.6 Täglicher Treiber – Codierung, Schreiben und mehrstufige Agentenschleifen.
  • Claude Sonnet 4.5 / 4 Schnelle Sonnet-Stufen mit sofortigem Caching für unterstützte Workloads.
  • Claude Haiku 4.5 Entwürfe, Klassifizierung und Unteraufgaben mit hohem Volumen mit geringer Latenz.

B2B-SaaS-Website-UI-Label. Übersetzen ins Natürliche von: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Neueste GPT-5-Familie für allgemeine und Agenten-Workloads.
  • GPT-4.1 & GPT-4o Zuverlässiger multimodaler Chat und Tool-Einsatz für Produktionsmitarbeiter.
  • GPT-4o mini Kosteneffizientes Routing für Zusammenfassungen und einfache Schritte.
  • o3 / o3-pro / o3-mini / o4-mini Argumentationsorientierte Modelle für Mathematik, Planung und Verifizierung.
  • GPT-5.3 Codex & Codex mini Codegenerierung, Refactors und Repo-fähige Agentenfähigkeiten.

B2B-SaaS-Website-UI-Label. Ins Natürliche übersetzen: Google Gemini

  • Gemini 2.5 Pro Langkontextrecherche und strukturierte Extraktion.
  • Gemini 2.5 Flash Agentenschritte mit hohem Durchsatz und wettbewerbsfähigen Token-Raten.
  • Gemini 2.0 Flash Ultraschnelle Durchläufe für Parsing, Tagging und Batch-Jobs.

Offene und spezielle APIs

  • DeepSeek Chat & Reasoner Großer Wert für Chat- und Gedankenkettenaufgaben.
  • Mistral Large In Europa gehostete Option für mehrsprachige Agententeams.
  • Llama 3.3 70B Open-Weights-Klassenmodell über API – lässt sich gut mit privater GPU kombinieren.
  • Grok 3 Echtzeitorientiertes Modell für Nachrichten- und Social-Monitoring-Agenten.
  • Sonar Pro Suchbasierte Antworten für Forschungsagenten.
  • Command R+ RAG-freundliche Unternehmens-Chat- und Abruf-Workflows.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Verwendung

Wie Agenten ein Modell auswählen

Der Koordinator kann je nach Aufgabentyp Sonnet vs. Opus vs. ein günstigeres Flash-Modell empfehlen. Hauptbenutzer legen Standardeinstellungen für jede Agentenrolle fest – Recherche bei Sonnet, abschließende Überprüfung bei Opus, Massen-Tagging bei Haiku oder Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPU-Verleih

Mieten Sie eine GPU und betreiben Sie Ihre eigenen Modelle

Benötigen Sie eine Feinabstimmung, einen Air-Gap-Kontrollpunkt oder eine vorhersehbare Inferenzpreisgestaltung? Fügen Sie Ihrem Digio-Arbeitsbereich dedizierte GPU-Kapazität hinzu, installieren Sie den von Ihnen bevorzugten Serving-Stack und verweisen Sie Agenten auf Ihren privaten Endpunkt.

Dedizierte Instanzen

Stündliche oder monatliche GPU-Knoten (Klasse A100, H100, L40S), die an Ihren Mandanten angeschlossen sind – isoliert von anderen Kunden.

Deine Gewichte

Laden Sie Safetensoren, GGUF hoch oder ziehen Sie sie aus Ihrer Registrierung. Führen Sie Llama, Mistral, Qwen und benutzerdefinierte Feinabstimmungen aus.

Standardportion

Von Ihnen verwaltete vLLM-, TGI-, Ollama- oder Container-Images – Digio-Agenten rufen eine OpenAI-kompatible Basis-URL auf.

Gleiche Orchestrierung

Team-Chat, Fähigkeiten und Zusammenarbeit bleiben unverändert – nur das Inferenz-Backend gehört Ihnen.

Hybrid-Routing

Senden Sie vertrauliche Schritte an eine private GPU und verwenden Sie Claude oder GPT für öffentliche Recherchen in einem Workflow.

Unternehmenskontrollen

VPC-Peering, statischer Egress, Audit-Protokolle und Modell-Zulassungslisten für regulierte Teams.

Bringen Sie Ihr eigenes Modell mit

Installieren und verbinden Sie ein benutzerdefiniertes Modell

Typisches Setup von Null bis Agenten, die Ihren Endpunkt anrufen:

  1. GPU reservieren

    Wählen Sie VRAM, Region und Betriebszeit (Burst vs. Always-On). Der Stauraum für Gewichte wird mit der Instanz geliefert oder ist auf Ihrem Eimer montiert.

  2. Stellen Sie den Stapel bereit

    Starten Sie ein Bereitstellungsimage oder SSH, installieren Sie CUDA-Treiber und laden Sie Prüfpunkte. Gesundheitschecks bestätigen, dass das Modell bereit ist.

  3. Endpunkt registrieren

    Fügen Sie in den Arbeitsbereichseinstellungen Basis-URL, API-Schlüssel und Modell-ID hinzu. Digio validiert Latenz und Token-Format, bevor es live geht.

  4. Den Agenten zuweisen

    Wählen Sie Ihr Privatmodell als Standard für ausgewählte Agenten; Verwaltete Claude/GPT-Modelle bleiben weiterhin nebeneinander verfügbar.

Die GPU-Miete wird separat von den Digio-Plan-Abonnements abgerechnet. Kontaktieren Sie uns für Kapazitätsplanung, SLAs und Migration von einem vorhandenen Inferenzcluster.

B2B-SaaS-Website-UI-Label. Ins Natürliche übersetzen: FAQ

Fragen zu Modellen und GPUs

Auswahl verwalteter APIs vs. selbstgehosteter Inferenz auf Digio.

Zahle ich zweimal – Plan plus API?

Ihr Digio-Abonnement umfasst Infrastruktur, Agenten und enthaltene Digio-Tokens. Die Nutzung des verwalteten Modells belastet den Token-Saldo mit den tatsächlichen Eingabe-/Ausgabe-Tokens. Die GPU-Vermietung ist ein Add-on für die von Ihnen gesteuerten Maschinen.

Können verschiedene Agenten unterschiedliche Modelle verwenden?

Ja – jeder Agent kann seinen eigenen Standard haben. Aufgaben und Chats können für eine einzelne Ausführung überschrieben werden, ohne dass die globale Standardeinstellung geändert wird.

Was ist der Unterschied zwischen Sonett und Opus?

Opus ist auf härtere Argumente und längere kohärente Pläne ausgelegt; Sonnet ist für alltägliche Agentenschleifen schneller und kostengünstiger. Haiku- und Flash-Klasse-Modelle eignen sich am besten für Volumen-Unteraufgaben.

Kann ich nur mein eigenes Modell ausführen und Cloud-APIs blockieren?

Unternehmensarbeitsbereiche können ausgehende Modellanbieter einschränken und den gesamten Agentenverkehr an Ihren GPU-Endpunkt weiterleiten. Der Hybridmodus ist für die meisten Teams die Standardeinstellung.

Welche GPU-Größen sind verfügbar?

Die Angebote hängen von der Region und der Nachfrage ab – üblicherweise 24–80 GB VRAM-Stufen für Modelle der Klassen 7B–70B und Multi-GPU-Knoten für größere Stacks. Wir helfen Ihnen bei der Dimensionierung des VRAM anhand Ihrer Parameteranzahl und Quantisierung.

Verbraucht die private GPU-Nutzung immer noch Digio-Tokens?

Die Orchestrierung (Agenten, Aufgaben, Speicher) bleibt in Ihrem Plan. Rückschlüsse auf Ihrer GPU werden als GPU-Zeit abgerechnet. Optional können Sie die tokenförmige Nutzung für interne Rückbuchungen messen.

Wählen Sie verwaltete Modelle oder bringen Sie Ihre GPU mit

Beginnen Sie noch heute mit Claude und GPT und fügen Sie dann eine dedizierte GPU hinzu, wenn Sie bereit sind, benutzerdefinierte Gewichtungen zu hosten – dieselben Agenten, dieselben Aufgaben, Ihre Schlussfolgerung.