GoGPT Best VPN GoSearch

OnWorks فافيكون

CC-Net download for Linux

Free download CC-Net Linux app to run online in Ubuntu online, Fedora online or Debian online

This is the Linux app named CC-Net whose latest release can be downloaded as cc_net1.0.0sourcecode.tar.gz. It can be run online in the free hosting provider OnWorks for workstations.

Download and run online this app named CC-Net with OnWorks for free.

اتبع هذه التعليمات لتشغيل هذا التطبيق:

- 1. قم بتنزيل هذا التطبيق على جهاز الكمبيوتر الخاص بك.

- 2. أدخل في مدير الملفات الخاص بنا https://www.onworks.net/myfiles.php؟username=XXXXX باسم المستخدم الذي تريده.

- 3. تحميل هذا التطبيق في هذا الملف.

- 4. ابدأ تشغيل OnWorks Linux عبر الإنترنت أو محاكي Windows عبر الإنترنت أو محاكي MACOS عبر الإنترنت من هذا الموقع.

- 5. من نظام تشغيل OnWorks Linux الذي بدأته للتو ، انتقل إلى مدير الملفات الخاص بنا https://www.onworks.net/myfiles.php؟username=XXXXX مع اسم المستخدم الذي تريده.

- 6. قم بتنزيل التطبيق وتثبيته وتشغيله.

SCREENSHOTS

Ad


شبكة الاتصالات المحلية


الوصف

cc_net provides tools to download, segment, clean, and filter Common Crawl to build large-scale text corpora, including monolingual datasets and the multilingual CC-100 collection introduced in the associated paper. It includes pipelines to fetch snapshots, extract text, de-duplicate, identify language, and apply quality filtering based on heuristics and language models. The outputs are intended for pretraining language models and for creating standardized corpora that can be reproduced or updated with new crawls. The repository documents practical concerns like HTTP failures, snapshot differences, and stats JSONs, reflecting community use across many languages. While powerful, the repo has been archived and is read-only, so users should expect to run it as-is or fork for maintenance. Even in archived state, issues and releases pages remain useful references for implementation details and dataset lineage.



شرح المميزات:

  • End-to-end Common Crawl download and extraction
  • Language identification and monolingual segmentation
  • Quality filtering and de-duplication pipelines
  • Support for building multilingual datasets like CC-100
  • Reproducible statistics and corpus metadata outputs
  • Scripts and configs for snapshot-by-snapshot processing


لغة البرمجة

Python


التصنيفات

معالجة اللغات الطبيعية (NLP)

This is an application that can also be fetched from https://sourceforge.net/projects/cc-net.mirror/. It has been hosted in OnWorks in order to be run online in an easiest way from one of our free Operative Systems.


خوادم ومحطات عمل مجانية

قم بتنزيل تطبيقات Windows و Linux

أوامر لينكس

Ad




×
الإعلانات
❤️تسوق أو احجز أو اشترِ هنا - بدون تكلفة، مما يساعد على إبقاء الخدمات مجانية.