Image Cover
Avatar

Sun* AI Research Team

level partner

Silver Content Creator

We're AI Research Team of R&D Lab @Sun Asterisk .Inc

Pinned Posts

Độ hot của Langchain

Langchain là một framework vô cùng hot hit trong thời gian gần đây. Nó được sinh ra để tận dụng sức mạnh của các mô hình ngôn ngữ lớn LLM như ChatGPT, LLaMA... để tạo ra các ứng dụng trong thực tế. Dù mới được phát triển cách đây khoảng 6 tháng (10/2022) và vẫn được cập nhật liên tục hàng ngày nhưng trên Github Langchain đã nhận được những tương tác khủng với lượng star lê...

Mayfest2023 ContentCreator
11.9K
53
22 8

All posts

Thumbnail Image
317
5
2 1
Avatar Nguyen Toan Thinh May 5th, 2023 8:29 a.m.
12 min read

SQL Query Antipatterns and Solution (Part 2)

Tiếp tục Seri về SQL Antipatterns, ở phần 1 mình đã giới thiệu với các bạn khái niệm về Antipatterns và một số Antipatterns đơn giản. Trong phần này chúng ta sẽ tiếp tục đi sâu vào những vấn đề phức tạp hơn. Cùng bắt đầu nào.

Một số SQL Antipatterns phổ biến (tiếp) 5. Tối ưu các công cụ tìm kiếm Đặt vấn đề Khi bạn muốn thực hiện tìm kiếm toàn văn bản, bạn sử dụng các toán tử khớp mẫu (ví dụ: L...

Thumbnail Image
679
5
3 1
Avatar Nguyen Toan Thinh May 5th, 2023 8:28 a.m.
12 min read

SQL Query Antipatterns and Solution (part 1)

SQL là một ngôn ngữ không còn xa lạ với mọi lập trình viên và đối với với lập trình viên backend việc làm chủ được SQL là một điều rất quan trọng. Trong quá trình làm việc của mình với SQL mình đã tham khảo rất nhiều nguồn để tìm hiểu các lỗi hay mắc phải, các giải quyết/tối ưu nó. Bài viết này mình sẽ chia sẻ những kỹ thuật mình đang sử dụng để tối ưu hệ thống của mình với SQL.

Antipatterns l...

Thumbnail Image
103
3
0 0
Avatar Trần Quang Vinh May 5th, 2023 8:27 a.m.
8 min read

[Paper explained] NISER: Normalized Item and Session Representations to Handle Popularity Bias

Nếu đã dùng qua các trang web như YouTube, có thể bạn đã từng để ý rằng một khi các bạn đã click vào một video nào đó, hệ thống của YouTube sẽ tự động gợi ý các video liên quan ở autoplay list hay là trang homepage. Điều này là do YouTube, dùng một Recommendation System để tự động gợi ý các video có độ liên quan cao đến video bạn vừa xem kể cả khi bạn đã login hay chưa login tài khoản Google. N...

Thumbnail Image
500
5
0 1
Avatar Trần Đức Trung May 5th, 2023 7:58 a.m.
14 min read

Một số điểm cần lưu ý khi sử dụng Airflow - Phần 2

Sự linh hoạt của Airflow giúp cho chúng ta có thể tùy biến tối đa mã nguồn để đáp ứng các mục đích khác nhau. Bài viết này liệt kê một số điểm cần lưu ý để có thể tổ chức cũng như tạo mã nguồn tối ưu để sử dụng chung với Airflow.

Import đúng chỗ, tạo biến đúng chỗ

Để tối ưu hiệu suất của Airflow, ta tốt nhất là chỉ viết mã cần thiết để tạo các operator, định nghĩa các hàm callable và định ngh...

Thumbnail Image
3.5K
12
5 0
Avatar Trung Đức May 5th, 2023 7:08 a.m.
18 min read

PySpark với một project Machine Learning nho nhỏ

Trong không khi người người MayFest, nhà nhà MayFest, tiếp nối series tự học và khám phá về Data Sience, trong bài viết hôm nay mình sẽ chia sẻ cùng mọi người kiến thức cơ bản cũng như thực hành về Spark với một project Machine Learning nho nhỏ.

Là một người đã hoặc đang làm việc với dữ liệu, chắc hẳn các bạn đã quá quen với việc lưu trữ dữ liệu trên máy local cá nhân hoặc server cá nhân, công...

Thumbnail Image
535
4
1 0
Avatar Đinh Trọng Huy May 4th, 2023 4:37 p.m.
14 min read

Evaluating and Testing models - có vẻ phức tạp hơn bạn nghĩ

Lời mở đầu Đánh giá/kiểm thử là một trong những khâu quan trọng nhất trong kỹ thuật phần mềm. Việc kiểm thử đảm bảo tránh các lỗi phát sinh trong quá trình sử dụng sản phẩm của người dùng, cũng như kiểm tra liệu sản phẩm đã đạt đến yêu cầu nào đó của người lập trình cũng như khách hàng.

Trong Machine Learning, mọi thứ cũng cơ bản là vậy. Đánh giá không chỉ đơn giản là dùng 1 metric nào đấy như...

Thumbnail Image
706
6
1 0
Avatar Nguyen Tung Thanh May 4th, 2023 12:43 p.m.
9 min read

[Paper Explain] Improved Denoising Diffusion Probabilistic Models (v1)

Giới thiệu Năm 2020, DDPM (Denoising Diffusion Probabilistic Models) đưa ra một số cải tiến, đơn giản hoá cho mô hình diffusion và đạt được SOTA trên tập CIFAR10. Vài tháng sau đó, đầu năm 2021, OpenAI xuất bản một paper đưa ra một số cải tiến cho DDPM. Trong bài viết này mình sẽ cố gắng làm nổi bật một số điều hay ho trong paper cải tiến này. Mặc dù rất nhiều settings trong DDPM vẫn còn được d...

Thumbnail Image
653
5
0 0
Avatar Hieu Bui May 4th, 2023 10:03 a.m.
8 min read

Cơ bản về fastai - Thư viện bậc cao cho Pytorch (P1)

Intro Hello mọi người, một mùa Mayfest nữa lại tới nên mình quay lại viết bài và chủ đề của bài viết ngày hôm nay là về thư viện fastai.

Nếu như trong Tensorflow có Keras thì Pytorch cũng có một số thư viện bậc cao để việc phát triển mô hình học sâu nhanh chóng và thuận tiện hơn như Lightning, Ignite và fastai. Fastai được thiết kế xung quanh 2 mục tiêu chính: Dễ tiếp cận và có thể nhanh chó...

Thumbnail Image
218
4
0 2
Avatar Bui Quang Manh May 4th, 2023 9:45 a.m.
7 min read

Tối ưu quá trình huấn luyện với tf.data API

A. Tensorflow data pipelines

Theo định nghĩa từ trang chủ Tensorflow , tf.data API cho phép bạn xây dựng đầu vào dữ liệu cho các mô hình từ đơn giản tới phức tạp. Nhưng cho dù đơn giản hay phức tạp, data pipeline cũng thường có 3 bước như sau:

  • Extract
  • Transform
  • Load

import tensorflow as tf import tensorlfow_datasets as tfds

extract phase dataset = tfds.load(name="mnist", split=...

Thumbnail Image
3.8K
9
2 0
Avatar Trần Đức Trung May 4th, 2023 9:40 a.m.
18 min read

Một số điểm cần lưu ý khi sử dụng Airflow - Phần 1

Airflow là một công cụ quản lý luồng dữ liệu phổ biến trong các hệ thống xử lý dữ liệu hiện đại. Tuy nhiên, việc sử dụng một tổ hợp nhiều thành phần như vậy đòi hỏi người dùng phải có nhiều kiến thức và kinh nghiệm để có thể sử dụng framework này một cách hiệu quả. Chính vì vậy, trong bài viết này, mình sẽ giới thiệu cho các bạn một số thứ cần quan tâm trong việc sử dụng Airflow, từ cách setup ...

Thumbnail Image
1.1K
8
1 0
Avatar Nguyen Mai May 4th, 2023 9:06 a.m.
14 min read

[Paper Explain] RTMDet: YOLO của OpenMMLab

Mở đầu Mình khá là thích OpenMMLab, một team nghiên cứu đã cung cấp rất nhiều repo tăng tốc các thử nghiệm như MMDetection, MMSegmentation, MMCV,... Đây là lần đầu mình đọc, và phân tích một paper của OpenMMLab. Về cơ bản thì đây chỉ là một họ model Object Detection rất là nhanh, và chính xác gọi là Real-Time Models for Object Detection: RTMDet. Ngoài Object Detection, RTMDet còn có thể thực hi...

Thumbnail Image
176
5
0 0
Avatar Trần Quang Vinh May 4th, 2023 8:52 a.m.
11 min read

[Paper explained] Non-local Neural Networks

Trong deep learning, việc lấy được các thông tin ở xa so với vị trí hiện tại khá là quan trọng. Ví dụ, với dữ liệu dạng sequence, ta có thể dùng phép recurrent để làm việc này. Còn với dữ liệu dạng ảnh, ta thường stack các phép convolution lên nhau để mở rộng receptive field. Cả hai phép này đều có đặc điểm là chúng chỉ xử lý các local neighborhood (các phép recurrent thường chỉ lấy thông tin c...

Thumbnail Image
1.8K
6
1 0
Avatar Trung Đức May 4th, 2023 8:13 a.m.
7 min read

Cùng thiết lập Multi Node Cluster trong Hadoop 2.x nào!

Trong bài viết trước của mình, mình đã giới thiệu về Hadoop và các thành phần của Hadoop. Hadoop là một hệ sinh thái mã nguồn mở được sử dụng để lưu trữ và xử lý dữ liệu lớn. Nhân tiện một ngày đẹp trời được giao task setup multi node cluster để làm 1 số công việc trên công ty, mình viết luôn một bài coi như node lại quá trình cài đặt cũng như kiểm thử về multi node cluster trong Hadoop.

Việc ...

Thumbnail Image
265
4
0 0
Avatar Bui Quang Manh May 4th, 2023 7:35 a.m.
7 min read

Graph execution và Eager execution trong Tensorflow

<img src="https://images.viblo.asia/0c976705-3d65-4272-8779-0972e528987c.png" >

   Figure 1. Eager Execution vs. Graph Execution  <br>
(https://towardsdatascience.com/eager-execution-vs-graph-execution-which-is-better-38162ea4dbf6)

Tensorflow là một nền tảng hỗ trợ cho việc học máy từ việc tải, xử lý dữ liệu đến huấn luyện, triển khai mô hình cùng vô vàn tác vụ khác.

Tensorflow...

Thumbnail Image
1.5K
34
8 1
Avatar Phạm Văn Toàn May 2nd, 2023 3:25 p.m.
23 min read

Hướng đi nào cho những người làm AI trong kỉ nguyên của các Super Large Models?

Lời mở đầu

Có lẽ thời gian chỉ trong vòng vài tháng trở lại đây, thế giới công nghệ đã bị khuynh đảo bởi các mô hình AI như ChatGPT, GPT-4, DALLE-2, Midjourney... Các mô hình AI đã thực sự tạo được cho người dùng những cảm xúc wow và có thể thấy rằng đâu đâu cũng nói về nó. Có phải kỉ nguyên mới của AI có phải đã bắt đầu rồi không? Bản thân mình nghĩ là CÓ. NÓ THỰC SỰ ĐÃ BÁT ĐẦU. Và chúng ta,...

Thumbnail Image
2.7K
77
17 6
Avatar Phạm Văn Toàn Apr 5th, 2023 1:12 p.m.
32 min read

Bóc trần hệ thống gợi ý của Twitter - một cú lừa ngày cá tháng tư???

Lời mở đầu

Xin chào các bạn, có lẽ gần đây thế giới công nghệ không khỏi choáng ngợp trước tần suất ra mắt của các sản phẩm AI từ ChatGPT, GPT-4 và gần đây nhất là vào ngày 1/4, Elon Musk và Twitter đã quyết định open source một phần của hệ thống gợi ý trên nền tảng Twitter tại đây và tại đây. Và mới chỉ sau hai ngày, repo này đã đạt được 38000 star trên Github đủ để thấy sức nóng của nó lớn đ...

Thumbnail Image
2.9K
27
14 2
Avatar Nguyen Tung Thanh Apr 4th, 2023 6:25 a.m.
23 min read

Diffusion Models cơ bản - Phần 1

Diffusion Models đang dần phổ biến. Nhiều trường đại học và khóa học đã đưa Diffusion Models vào chương trình giảng dạy. Mình viết bài này với hy vọng bài viết này sẽ có ích phần nào với các bạn muốn tìm hiểu về Diffusion Models.

Một số từ tạm dịch

  • Diffusion: khuếch tán
  • Quasi-static process: quá trình chuẩn tĩnh
  • Thermodynamic Equilibrium: cân bằng nhiệt động học (NĐH)
  • Forward Diffusion...
Thumbnail Image
1.3K
8
2 0
Avatar Trung Đức Apr 4th, 2023 2:53 a.m.
15 min read

Hadoop thì có liên quan gì tới Big Data?

Ở nội dung các bài viết trước, mình có giới thiệu qua về nội dung khóa học Data Science Fundamental và Data Analytics Fundamental để làm những bước đệm cho việc học về Data Science nói chung. Chắc hẳn nếu bạn có bạn bè làm về Data Science (Data Engineer, Data Scientist, ..) thì các cái tên Hadoop, Spark, ... được nhắc lại nhiều lần và bạn có thể giống mình sẽ tự hỏi: Nó là gì? Mình có tìm các k...

Thumbnail Image
938
20
6 0
Avatar Nguyen Mai Apr 3rd, 2023 3:02 a.m.
16 min read

[Paper Explain] Clustering trong Computer Vision: Hướng đi mới thay thế CNN và Transformer?

Tóm tắt Ảnh là gì và làm thế nào để trích xuất features? Convolutional Neural Network (CNN). CNN xem ảnh là các pixel có tổ chức theo dạng hình chữ nhật và thực hiện trích xuất features sử dụng phép Convolution ở một vùng cục bộ. Vision Transformer (ViT). ViT xem ảnh là một chuỗi các patch và thực hiện trích xuất features sử dụng phép Self-Attention ở khoảng cách toàn ảnh.

Và bài này sẽ giới t...

Thumbnail Image
4.4K
8
0 0
Avatar Pham Thi Hong Anh Mar 30th, 2023 6:04 a.m.
6 min read

Mean, Median, Variance, Standard Deviation với Python

Chào các bạn, như các bạn cũng biết xác suất thống kê khá là quan trọng trong Xử lý dữ liệu (data analysis) cũng như khoa học dữ liệu (data Science) vì nó giúp chúng ta hiểu rõ hơn về dữ liệu mình có. Và mình dạo này khá là rảnh rỗi nên học lại kiến thức xác suất thống kê và đây là bài viết đầu tiên trong chuỗi Series Xác suất thống kê với python . Chúng ta cùng bắt đầu thôi nhé.

Mean, Median...

Featured member
Viblo
Let's register a Viblo Account to get more interesting posts.